招聘公告 · 职位检索 · 央国企/事业单位/名企

AI异构硬件训练优化专家 - Seed Model

单位:字节跳动类别:机器学习类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点上海
官方更新时间2026-06-03 16:21:19

职位描述

团队介绍:字节跳动 Seed 团队成立于 2023 年,致力于寻找通用智能的新方法,追求智能上限,为科技和社会发展作出贡献。

Seed 团队在 AI 领域拥有长期愿景与决心,团队研究方向涵盖 MLLM、GenMedia、AI for Science、机器人等,在中国、新加坡、美国等地设有实验室和岗位。目前,团队已推出业界领先的通用大模型以及前沿的多模态能力,支持豆包、即梦、TRAE 等超过 50 个应用场景,并通过火山引擎开放给企业客户。第三方数据显示,豆包 App 用户量在中国市场排名第一,豆包大模型日均 Token 调用量行业领先。

1、该岗位面向超大规模AI加速卡集群,负责豆包Seed自研LLM模型训练任务的性能优化与稳定性建设,深度参与训练框架、通信链路、算子库和集群调度等核心环节,支撑万卡规模训练任务高效、稳定运行;

2、训练框架优化:优化数据并行、张量并行、流水并行、专家并行和混合并行策略,提升端到端训练吞吐与扩展效率;

3、集群性能与稳定性:围绕计算、通信、显存、调度、Checkpoint、容错恢复等链路,解决静默数据错误、网络抖动、通信瓶颈和异常定位问题;

4、软硬件协同优化:推动训练框架、算子库、通信网络、编译栈和计算架构协同,使超大规模AI加速卡集群稳定承载LLM训练。

任职要求

1、计算机、软件工程、人工智能、电子信息、微电子等相关专业优先;

2、熟悉Linux环境下的C/C++或Python,具备扎实的编程能力和工程习惯;

3、熟悉计算机体系结构、芯片微架构、高性能计算、分布式系统、并行计算中的至少一个方向;

4、了解PyTorch、Megatron、DeepSpeed、FSDP、TorchTitan等训练框架或分布式训练系统中的至少一种;

5、关注万卡规模训练中的吞吐、显存、通信、扩展效率、任务稳定性和异常定位问题。

加分项:

1、有超大规模GPU/NPU集群LLM训练优化、分布式训练框架、通信库优化经验;

2、熟悉NCCL、HCCL、RDMA、RoCE、集合通信、通信计算融合或网络性能分析;

3、了解MoE训练、混合精度训练、ZeRO、Checkpoint优化、容错恢复、长周期稳定训练相关技术;

4、有静默数据错误定位、硬件故障分析、集群稳定性建设、训练任务调优经验;

5、有OI/ACM、HPC竞赛、系统竞赛、科研项目或开源项目经历。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。