AI Infrastructure Lead
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海、北京 |
| 官方更新时间 | 2026-03-12 10:43:41 |
职位描述
职位背景
我们正在建设一个面向 具身智能(Embodied AI)与机器人学习 的大规模研究中心,拥有 大规模 GPU 集群与真实机器人数据闭环。团队致力于研发 多模态大模型(Multimodal Foundation Model)、VLA(Vision-Language-Action)、强化学习(Reinforcement Learning)与世界模型(World Model) 等核心技术。
我们在招聘 ML Infrastructure Lead,负责设计和建设支持大规模模型训练的 机器学习平台与分布式训练基础设施,包括 训练系统、GPU 集群调度、实验平台与数据训练 pipeline,以支持研究团队在大规模计算环境下高效进行模型训练与算法迭代。
工作职责
负责机器学习基础设施与训练平台的架构设计与建设
设计并维护 大规模 GPU 集群训练系统(H100/H200 等)
构建支持 大模型(LLM / Multimodal / VLA) 的分布式训练系统
搭建 训练 pipeline(dataset → preprocessing → training → evaluation → deployment)
设计和实现 实验管理系统(Experiment Tracking)、模型版本管理(Model Registry)
优化 GPU 利用率、通信效率与训练稳定性
与研究团队合作支持 大模型训练、强化学习训练与多模态模型训练
与机器人系统团队合作,实现模型 推理部署(Inference / Serving)
组建并领导 ML Infrastructure 团队
任职要求
任职要求
计算机、人工智能或相关专业 硕士及以上学历
5年以上机器学习工程或 AI 平台经验
熟悉主流深度学习框架:PyTorch / JAX / TensorFlow
熟悉分布式训练技术:FSDP / Megatron / DeepSpeed / Horovod
熟悉 GPU 集群与训练调度系统:Slurm / Kubernetes / Ray
熟悉机器学习训练 pipeline 与数据系统:dataset pipeline / experiment tracking / model registry
熟悉 GPU 计算优化:CUDA / NCCL / mixed precision / memory optimization
具备良好的系统架构能力与团队协作能力
加分项
有大模型训练(LLM / Multimodal Foundation Model) 经验
有强化学习(RL / RLHF / Offline RL) 训练平台经验
有自动驾驶 ML Infra 或 AI 平台团队经验
有管理 数百至上千 GPU 集群训练任务 的经验
有构建 AI Training Platform / ML Platform 的经验
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。