招聘公告 · 职位检索 · 央国企/事业单位/名企

分布式训练工程师(J10983)

单位:摩尔线程类型:校招地点:北京市、杭州市、深圳市、上海市、无锡市更新:2026-09-24

岗位信息

招聘单位摩尔线程
工作地点北京市、杭州市、深圳市、上海市、无锡市
官方更新时间2026-08-10T22:00:33

职位描述

欢迎加入摩尔线程!我们团队专注于语言 / 多模态 / 多模态生成模型的训练和后训练(包括精调和强化学习)的训练性能极致优化和算法稳定性调优,开展软硬件算法全流程 coDesign,拥有大量万卡以上大集群万亿以上参数大模型的训练调优实践经验,欢迎对大模型基础架构 / 强化学习 / 多模态 / 视频生成、超大规模 GPU 集群训推优化和软硬协同设计感兴趣的同学加入!

岗位职责

1、超大规模 GPU 集群分布式训练技术的研究与实现,提升 MOE 大模型和强化学习的训练吞吐。

2、开展大模型前沿算法调研和实现,服务分布式训练性能与稳定性优化。

3、负责大模型训练框架研发与性能调优。

任职要求

任职资格:

1、计算机、人工智能、软件工程等相关专业,具备扎实的算法与计算机基础,欢迎基础扎实的在读同学投递。

2、掌握 Python 或 C++,具备良好编程风格,能够熟练使用 PyTorch/Jax/Paddle 等深度学习框架。

3、熟悉深度学习及大模型训练相关算法。

4、具备较强的责任心、学习能力、沟通能力与自驱力,工作细致有规划,善于透过现象挖掘问题本质。

【加分项】

有大规模 GPU 集群调优、参数服务器、多维并行、显存交换、MPI 相关实践

有 Megatron/DeepSpeed/ColossalAI/TransformerEngine/torchtitan/sglang/vllm 框架实践经验

有大模型算法研究、CUDA/triton/tilelang 开发、算法‑infra coDesign 相关经历

拥有顶会论文或者竞赛经历

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。