分布式训练工程师(J10983)
岗位信息
| 招聘单位 | 摩尔线程 |
|---|---|
| 工作地点 | 北京市、杭州市、深圳市、上海市、无锡市 |
| 官方更新时间 | 2026-08-10T22:00:33 |
职位描述
欢迎加入摩尔线程!我们团队专注于语言 / 多模态 / 多模态生成模型的训练和后训练(包括精调和强化学习)的训练性能极致优化和算法稳定性调优,开展软硬件算法全流程 coDesign,拥有大量万卡以上大集群万亿以上参数大模型的训练调优实践经验,欢迎对大模型基础架构 / 强化学习 / 多模态 / 视频生成、超大规模 GPU 集群训推优化和软硬协同设计感兴趣的同学加入!
岗位职责
1、超大规模 GPU 集群分布式训练技术的研究与实现,提升 MOE 大模型和强化学习的训练吞吐。
2、开展大模型前沿算法调研和实现,服务分布式训练性能与稳定性优化。
3、负责大模型训练框架研发与性能调优。
任职要求
任职资格:
1、计算机、人工智能、软件工程等相关专业,具备扎实的算法与计算机基础,欢迎基础扎实的在读同学投递。
2、掌握 Python 或 C++,具备良好编程风格,能够熟练使用 PyTorch/Jax/Paddle 等深度学习框架。
3、熟悉深度学习及大模型训练相关算法。
4、具备较强的责任心、学习能力、沟通能力与自驱力,工作细致有规划,善于透过现象挖掘问题本质。
【加分项】
有大规模 GPU 集群调优、参数服务器、多维并行、显存交换、MPI 相关实践
有 Megatron/DeepSpeed/ColossalAI/TransformerEngine/torchtitan/sglang/vllm 框架实践经验
有大模型算法研究、CUDA/triton/tilelang 开发、算法‑infra coDesign 相关经历
拥有顶会论文或者竞赛经历
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。