训练系统专家
岗位信息
| 招聘单位 | 美团 |
|---|---|
| 部门/事业群 | 软硬件服务-无人车业务部 |
| 工作地点 | 北京市 |
| 官方更新时间 | 1786448949000 |
职位描述
1. 负责自动驾驶模型训练效率与算法迭代效率方向的技术规划和团队管理,持续优化从实验提交、训练执行到评测结果产出的端到端周期;
2. 负责大规模分布式训练性能优化,围绕计算、显存、通信、数据加载、存储等环节定位瓶颈,持续提升训练吞吐、GPU 利用率、扩展效率和训练产出;
3. 建设和优化统一训练能力,包括但不限于分布式训练框架、训练 Profiling、故障诊断、Checkpoint/容错恢复、实验管理及性能回归分析等工具和平台能力;
4. 深入感知、端到端、世界模型等算法研发流程,与算法、数据、存储和算力平台团队协作,推动重点模型训练效率专项并沉淀为通用能力;
5. 建立训练效率和研发迭代效率指标体系,以训练耗时、任务成功率、资源利用率、实验迭代周期等指标衡量并持续改善平台效果;
任职要求
1. 计算机、人工智能、软件工程等相关专业本科及以上学历,具有机器学习系统、分布式训练或相关工程经验,有 Tech Lead 或小团队管理经验;
2. 深入理解 PyTorch 等主流深度学习框架及分布式训练机制,熟悉 DDP、FSDP、DeepSpeed、Megatron-LM 等技术中的一种或多种;
3. 熟悉 Linux、Python,并具备良好的系统开发能力;理解 CUDA、NCCL、RDMA、InfiniBand/RoCE、GPU 架构等相关技术;
4. 具备较强的训练性能分析与系统优化能力、技术判断和跨团队推动能力,能够将单点性能问题抽象并沉淀为可复用的平台能力,对最终算法研发效率负责;
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。