计算集群系统工程师(J10990)
岗位信息
| 招聘单位 | 摩尔线程 |
|---|---|
| 工作地点 | 北京市 |
| 官方更新时间 | 2026-08-10T21:19:47 |
职位描述
欢迎加入摩尔线程!我们搭建面向 AI 训练与推理的大规模计算基础设施,涵盖 GPU 集群资源管理、分布式训练平台、高性能推理框架与服务、调度及可观测性等方向。期待计算机基础扎实、愿意深耕系统底层、热衷于攻克大规模工程难题的同学加入!
岗位职责
1、参与大规模 GPU 集群的规划、设计和开发,支持并参与 AI 训练平台和高性能 AI 推理系统的研发,优化大规模系统中 AI 训练、推理的性能和稳定性。
2、参与分布式系统、存储、网络、计算等基础能力建设,解决大规模场景下的性能与可靠性问题。
3、与算法、模型、业务及基础设施团队协作,将前沿模型能力稳定、高效地落地到生产环境。
任职要求
任职资格:
1、计算机科学、软件工程、人工智能、电子工程或相关专业本科及以上学历。
2、扎实的计算机基础,理解操作系统、计算机网络、数据结构与算法等核心知识。
3、熟悉至少一种编程语言,如 C++、Go、Python、Rust 或 Java,具备良好的代码质量意识。
4、对并发编程、Linux 系统、分布式系统、性能优化等至少一个方向有兴趣或实践。
5、具备较强的学习能力、分析与解决问题的能力,能够主动推进事情落地。
6、有良好的沟通协作能力,对工程质量和系统稳定性有责任心。
【加分项】
有 Kubernetes、Docker、Slurm、Ray 等集群调度或云原生相关实践
了解 GPU、CUDA、NCCL、RDMA、高性能网络或异构计算
参与过 PyTorch、TensorFlow 等训练框架,或 vLLM、TensorRT、SGLang 等推理框架相关项目
有分布式系统、数据库、存储系统、编译器、网络协议栈等课程设计、科研或开源贡献
在竞赛、开源社区、个人项目中展现出较强的工程实现或问题解决能力
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。