AI异构硬件训练优化专家-Seed
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-06-03 16:21:59 |
职位描述
团队介绍:字节跳动Seed团队成立于2023年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。
Seed团队在AI领域拥有长期愿景与决心,团队研究方向涵盖MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位;目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE等超过50个应用场景,并通过火山引擎开放给企业客户;第三方数据显示,豆包App用户量在中国市场排名第一,豆包大模型日均Token调用量行业领先。
1、该岗位面向超大规模AI加速卡集群,负责豆包Seed自研LLM模型训练任务的性能优化与稳定性建设,深度参与训练框架、通信链路、算子库和集群调度等核心环节,支撑万卡规模训练任务高效、稳定运行;
2、训练框架优化:优化数据并行、张量并行、流水并行、专家并行和混合并行策略,提升端到端训练吞吐与扩展效率;
3、集群性能与稳定性:围绕计算、通信、显存、调度、Checkpoint、容错恢复等链路,解决静默数据错误、网络抖动、通信瓶颈和异常定位问题;
4、软硬件协同优化:推动训练框架、算子库、通信网络、编译栈和计算架构协同,使超大规模AI加速卡集群稳定承载LLM训练。
任职要求
1、计算机、软件工程、人工智能、电子信息、微电子等相关专业优先;
2、熟悉Linux环境下的C/C++或Python,具备扎实的编程能力和工程习惯;
3、熟悉计算机体系结构、芯片微架构、高性能计算、分布式系统、并行计算中的至少一个方向;
4、了解PyTorch、Megatron、DeepSpeed、FSDP、TorchTitan等训练框架或分布式训练系统中的至少一种;
5、关注训练中的吞吐、显存、通信、扩展效率、任务稳定性和异常定位问题。
加分项:
1、有GPU/NPU集群LLM训练优化、分布式训练框架、通信库优化经验;
2、熟悉NCCL、HCCL、RDMA、RoCE、集合通信、通信计算融合或网络性能分析;
3、了解MoE训练、混合精度训练、ZeRO、Checkpoint优化、容错恢复、长周期稳定训练相关技术;
4、有静默数据错误定位、硬件故障分析、集群稳定性建设、训练任务调优经验;
5、有OI/ACM、HPC竞赛、系统竞赛、科研项目或开源项目经历。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。