招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infra 工程师

单位:宇树科技类型:校招地点:杭州市更新:2026-09-24

岗位信息

招聘单位宇树科技
工作地点杭州市
官方更新时间2026-06-15T20:40:27

职位描述

1. 负责⼤规模算⼒集群下AI框架的设计与建设。

2. 构建并维护⼤规模算⼒集群的分布式训练系统,⽀持⼤模型训练。

3. 优化⼤模型训练 GPU 利⽤率、内存占⽤和训练吞吐量,消除训练瓶颈。

4. 优化数据加载器效率,缩短从数据到达模型训练的耗时。

5. 与研发团队密切合作,⽀持多模态⼤模型及运控模型训练优化。

6. 构建低延迟推理流⽔线:⽤于机器⼈实时控制,并应⽤量化(Quantization)、蒸馏(Distillation)和模型编译等技术优化推理性能。

任职要求

1. 具备千卡级 GPU 集群训练实践,熟悉⼤模型训练中的常⻅问题与系统级解决⽅案;

2. 熟练掌握 DDP / FSDP 等分布式机制底层原理;

3. 熟练运⽤ DeepSpeed、Megatron-LM 等主流框架;

4. 具备结合模型结构制定最优并行策略方案能⼒;

5. 具备全栈性能分析能⼒,能够⾼效识别训练过程中计算、通信与数据加载链路中的关键瓶颈,并进⾏针对性优化;

6. 有ML Infra 或 AI 训练平台构建经验者优先。

7. 有多模态⼤模型及强化学习训练经验者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。