招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型训练系统与优化工程师(VLM/Agent RL方向)-Data

单位:字节跳动类别:算法类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点上海
官方更新时间2026-04-22 12:03:37

职位描述

1、统一训练架构建设与演进:负责大模型Post-training框架的代码抽象与底层重构,兼容不同模态、不同训练方式的、正确的、高效的训练框架的建设;

2、超大规模分布式训练优化:面向100B~1T参数级别的超大模型,探索并落地极致的分布式训练策略(DP/TP/PP/EP等组合),通过算子融合、显存优化、分布式策略调整等手段大幅提升集群训练的MFU;

3、Agent RL框架与评估底座建设:攻坚Reasoning RL/Agent RL的训练框架,构建适用于复杂业务环境的标准化评测基准与标准的、稳定的Harness,解决千亿模型在RL阶段的稳定收敛与Rollout效率问题,解决在Agent RL下的长尾问题;

4、多模态与新架构支持:为MoE、Linear Attention等新型模型结构,以及多模态(图、文、音、视)复杂模态的模型训练提供高效支持与正确性(Convergence)验证。

任职要求

1、具备2年以上机器学习系统设计、开发与性能调优经验,熟练掌握Python与C++;

2、深入理解并具备PyTorch、DeepSpeed、Megatron或FSDP等主流分布式训练框架的二次开发经验;

3、有100B以上超大模型分布式训练实战经验,能够独立排查并解决收敛性问题与分布式训练瓶颈;

4、在强化学习训练框架(PPO/GRPO/Agent RL)或大模型评测底座、Agentic Harnes有深度实践者优先;

5、具备工程素养,对提升AI Infra的研发效率、代码整洁度与系统稳定性有追求。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。