招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型训练框架工程师

单位:MiniMax类别:互联网 / 电子 / 网游类型:社招地点:北京、上海更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点北京、上海
官方更新时间2026-09-04 22:23:04

职位描述

训练顶尖大模型不仅依赖算法创新,也依赖稳定、高效、可扩展的训练系统。随着模型规模和训练复杂度持续提升,训练效率、并行策略、通信开销、显存管理、Checkpoint、容错恢复、大规模数值正确性保证和系统稳定性,都会直接影响模型迭代速度和能力上限。

我们正在建设 MiniMax 大模型训练框架,支撑更大规模、更高效率、更稳定的训练任务。你将与算法团队在模型架构设计和训练方案制定阶段深度协作,从系统视角参与技术判断,识别潜在瓶颈,并推动训练系统持续优化。

你会参与:

- 建设和优化大规模训练框架,支撑千卡/万卡级别训练任务;

- 优化数据并行、张量并行、流水线并行、专家并行等并行策略;

- 解决大规模训练中的通信、显存、Checkpoint、容错恢复、数值正确性校验和稳定性问题;

- 分析模型结构、训练策略与系统效率之间的关系,提升训练吞吐、资源利用率和迭代效率;

- 跟进 PyTorch、Megatron-LM、DeepSpeed、TorchTitan 等训练框架及相关前沿工作,并结合实际训练场景落地。

我们希望你在分布式系统、GPU 性能优化、并行计算、通信优化、训练框架或系统稳定性等方向具备扎实积累,同时对大模型训练系统保持持续兴趣,愿意面对真实复杂系统中的高难度问题。

任职要求

基本要求:

- 编程能力扎实,具备清晰的系统设计思路和良好的工程品味;

- 对大模型训练系统、分布式系统、并行计算、GPU 性能优化或大规模数值正确性保障中的某一方向有深入理解;

- 能够独立定位系统问题,提出可落地的优化方案并推动实施;

- 关注算法与系统前沿,能够将论文或开源框架中的思路转化为工程判断。

加分项:

- 熟悉 PyTorch、Megatron-LM、DeepSpeed、Colossal-AI、TorchTitan 等训练框架,并有深入使用或贡献经验;

- 有千卡/万卡规模训练系统经验;

- 熟悉 NCCL、RDMA、CUDA、Triton、通信优化、显存优化、Checkpoint 优化、大规模训练数值稳定性与正确性保障等技术;

- 有 MoE 训练、长序列训练、混合并行策略优化或训练稳定性治理经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。