AI Infra Engineer(预训练框架与性能优化)
岗位信息
| 招聘单位 | 小鹏汽车 |
|---|---|
| 工作地点 | 深圳、北京、上海 |
| 官方更新时间 | 2026-09-14 18:35:48 |
职位描述
面向 VLA 与 World Action Model(视频生成与多模态模型)的预训练需求,参与自研训练框架的开发与演进。通过训练性能分析、分布式执行优化、训练稳定性治理与算法工程协作,提升训练效率与资源利用率,降低训练成本,逐步推动预训练、微调、蒸馏与强化学习共用核心基础能力,支撑不同模型和业务场景的持续扩展。
【职位描述】
1. 训练框架研发:负责预训练框架核心模块的设计、开发与迭代,支持模型、数据、优化器与训练策略的灵活接入;建设统一的训练执行与状态管理机制,完善 checkpoint 保存恢复、指标记录与评测接口,保障训练正确性、可复现性与兼容性;
2. 端到端性能优化:建立性能分析与评测体系,定位数据处理、计算、显存和通信等环节的瓶颈;优化数据加载与预处理流水线、模型计算与显存使用,评估算子优化、编译、低精度等技术的收益,提升 GPU 有效利用率与训练吞吐;
3. 分布式训练与规模扩展:优化并行策略、通信与计算重叠及负载均衡;开展 NCCL 集合通信性能分析与优化,结合 GPU 互联和网络拓扑定位带宽、时延和慢节点问题,完成百卡到千卡规模的扩展验证与容量规划;
4. 训练可靠性与工程效能:建设训练监控、日志、告警与诊断能力,定位并解决 OOM、NaN、卡死等稳定性问题;完善训练状态保存、故障恢复和重试机制,开展故障演练与复盘,降低长任务中断与人工干预;
5. 公共训练能力沉淀:推进分布式执行、资源管理、保存恢复与性能分析等公共能力的抽象与复用,支持预训练与强化学习框架的融合,使视频模型预训练与现有 RL 任务共用核心基础能力。
任职要求
1. 扎实的 Python 编程与软件工程能力,熟悉 PyTorch,能够独立完成模块设计、开发、调试与验证;
2. 具有大模型训练框架或分布式训练系统研发经验,熟悉 FSDP、Megatron、DeepSpeed 等框架中的至少一种;
3. 熟悉并行训练、显存管理、分布式通信等关键机制,了解 GPU 计算、显存管理与异步执行机制;
4. 具备系统性能分析与优化能力,熟悉 PyTorch Profiler、Nsight 等工具,能够结合 CPU、GPU、内存和通信等运行信息定位问题;
5. 了解 Transformer、扩散模型等模型的基本计算特点,能够理解算法需求并转化为合理的工程实现;
6. 具备复杂训练任务的排障经验和良好的协作能力,能够与算法团队共同完成问题定位、方案验证和持续改进。
【加分项】
1. 有视频生成、多模态模型或 DiT 训练经验,熟悉 FastVideo、DiffSynth-Studio、Diffusers 等项目;
2. 熟悉 NCCL 及 AllReduce、AllGather、ReduceScatter 等集合通信机制,具备通信性能测试、调优或故障定位经验;
3. 有 CUDA / Triton 算子开发、编译优化、低精度训练或高性能数据处理经验;
4. 有大规模 GPU 集群、分布式 checkpoint、训练故障治理或运维工具开发经验;
5. 有 AReaL、verl、RLinf 等强化学习框架的使用或开发经验,参与过多类训练流程的整合与公共模块设计。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。