招聘公告 · 职位检索 · 央国企/事业单位/名企

AI infra-主机研发工程师

单位:MiniMax类别:基础架构类型:社招地点:北京、上海更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点北京、上海
官方更新时间2025-03-04 14:58:40

职位描述

一、岗位定位

参与建设支撑大模型训练与推理的主机基础设施,将大规模 GPU 服务器打造为可编程、可观测、可诊断、可自愈的标准化计算节点,持续提升 AI 集群的稳定性、资源利用率和扩展效率。

二、你将负责

1. 设计和研发 GPU 主机管理控制面,实现节点状态管理、配置下发、故障诊断、自动恢复和交付验收。

2. 打通物理硬件、Linux 操作系统、容器与资源调度平台,推动主机能力标准化、平台化。

3. 深入 GPU、CPU、内存、网络和存储等关键链路,定位并解决复杂的稳定性与性能问题。

4. 建设面向大规模节点的监控、故障决策和自动化运维体系,降低人工维护成本。

5. 优化主机系统架构与运行机制,提升集群资源利用率、可靠性和规模化交付效

率。

6. 与硬件、数据中心、网络、存储、调度及业务团队协作,推动基础设施能力持续演进。

任职要求

三、我们期望你具备

1. 计算机、软件工程、电子信息或相关专业本科及以上学历。

2. 深入理解 Linux、操作系统和计算机体系结构,具备跨应用、系统与硬件分析问题的能力。

3. 熟悉 GPU 服务器,理解 CPU、内存、网络、存储及硬件拓扑之间的关系。

4. 熟练掌握 Go、Python、C/C++ 中至少一门语言,具备良好的系统设计、编码和调

试能力。

5. 能够通过建立假设、设计实验和分析数据,定位跨软硬件栈的复杂问题。

6. 具备规模化系统思维,关注故障边界、一致性、可观测性和自动恢复能力。

7. 具备较强的 Owner 意识,能够推动系统从设计、研发到上线及长期稳定运行。

四、加分项

- 有大规模 GPU 集群、AI Infra、HPC 或智算中心建设经验。

- 有公有云 IaaS、裸金属服务、主机控制面或分布式基础设施研发经验。

- 熟悉 Linux 内核、eBPF、GPU 软件栈、高性能网络或存储系统。

- 有系统性能优化、复杂生产故障诊断或自动化运维经验。

- 对软硬件协同、系统性能和基础设施工程有持续的兴趣与实践。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。