招聘公告 · 职位检索 · 央国企/事业单位/名企

AI加速软件资深研发工程师-芯片研发

单位:字节跳动类别:研发类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点上海
官方更新时间2026-06-05 11:16:53

职位描述

1、负责大模型在自研AI芯片上的性能评估与软硬件协同优化,主导方案设计、计算、通信全链路适配和调优;

2、对接算法,负责字节跳动大模型例如豆包、Seedance等在自研硬件不同分布式方案设计性能评估、roofline建模和集群成本分析等,协助业务落地的软硬件协同设计;

3、负责高性能计算算子与集合通信算子的设计、实现与优化,主导大模型分布式训练/推理场景下计算与通信的融合及重叠优化,追求极致的端到端吞吐与性价比;

4、负责模型量化、稀疏、蒸馏等部署方案的探索与落地,构建分布式推理系统并对推理框架做极致调优;

5、牵引关键技术难题攻关,制定技术路线,指导并培养团队成员,推动跨团队(算法、框架、驱动、硬件、芯片验证)协同与自研软件栈的架构演进;主动探索针对硬件,创新的部署方案和软件栈方案设计。

任职要求

1、计算机/电子工程相关专业,硕士学位及以上优先,4年以上AI编译器、算子或高性能通信相关研发经验;

2、深入理解AI加速硬件体系结构与并行计算,精通多层级存储、片上NOC与片间互联原理,能从体系结构视角驱动软硬件协同设计;

3、精通C/C++与Python,具备扎实的算法功底与大型软件系统的架构设计、性能优化能力;

4、深入掌握主流深度学习框架的底层计算与运行时机制,对常见算子的底层实现有深刻理解;

5、具备技术领导力与较强自驱力,能独立牵引复杂技术攻关,沟通协作与问题分析解决能力优秀。

以下为加分项

1、深入理解LLM与多模态模型(如Qwen、DeepSeek等),有大模型分布式训练/推理框架的研发与调优经验,有大模型训练千卡以上集群训练落地经验;

2、熟悉NCCL、DeepEP等集合通信库与RDMA原理,有自研集合通信库或芯片互联的研发与优化经验;

3、熟悉GPU或主流AI DSA体系结构与CUDA等异构编程模型,有算子优化、图编译优化或硬件评测的实战经验;

4、有AI加速硬件量化工具的开发经验,熟悉模型量化、稀疏、剪枝、蒸馏等压缩技术的落地;

5、熟悉AI服务器与集群架构,对多层级卡间互联Topo有实践经验,有大规模分布式部署落地经历。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。