招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infrastructure Lead

单位:智元机器人类别:研发类型:社招地点:上海、北京更新:2026-09-24

岗位信息

招聘单位智元机器人
工作地点上海、北京
官方更新时间2026-03-12 10:43:41

职位描述

职位背景

我们正在建设一个面向 具身智能(Embodied AI)与机器人学习 的大规模研究中心,拥有 大规模 GPU 集群与真实机器人数据闭环。团队致力于研发 多模态大模型(Multimodal Foundation Model)、VLA(Vision-Language-Action)、强化学习(Reinforcement Learning)与世界模型(World Model) 等核心技术。

我们在招聘 ML Infrastructure Lead,负责设计和建设支持大规模模型训练的 机器学习平台与分布式训练基础设施,包括 训练系统、GPU 集群调度、实验平台与数据训练 pipeline,以支持研究团队在大规模计算环境下高效进行模型训练与算法迭代。

工作职责

负责机器学习基础设施与训练平台的架构设计与建设

设计并维护 大规模 GPU 集群训练系统(H100/H200 等)

构建支持 大模型(LLM / Multimodal / VLA) 的分布式训练系统

搭建 训练 pipeline(dataset → preprocessing → training → evaluation → deployment)

设计和实现 实验管理系统(Experiment Tracking)、模型版本管理(Model Registry)

优化 GPU 利用率、通信效率与训练稳定性

与研究团队合作支持 大模型训练、强化学习训练与多模态模型训练

与机器人系统团队合作,实现模型 推理部署(Inference / Serving)

组建并领导 ML Infrastructure 团队

任职要求

任职要求

计算机、人工智能或相关专业 硕士及以上学历

5年以上机器学习工程或 AI 平台经验

熟悉主流深度学习框架:PyTorch / JAX / TensorFlow

熟悉分布式训练技术:FSDP / Megatron / DeepSpeed / Horovod

熟悉 GPU 集群与训练调度系统:Slurm / Kubernetes / Ray

熟悉机器学习训练 pipeline 与数据系统:dataset pipeline / experiment tracking / model registry

熟悉 GPU 计算优化:CUDA / NCCL / mixed precision / memory optimization

具备良好的系统架构能力与团队协作能力

加分项

有大模型训练(LLM / Multimodal Foundation Model) 经验

有强化学习(RL / RLHF / Offline RL) 训练平台经验

有自动驾驶 ML Infra 或 AI 平台团队经验

有管理 数百至上千 GPU 集群训练任务 的经验

有构建 AI Training Platform / ML Platform 的经验

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。