大模型算力负责人
岗位信息
| 招聘单位 | MiniMax |
|---|---|
| 工作地点 | 上海、北京、杭州 |
| 官方更新时间 | 2025-05-28 18:52:22 |
职位描述
1. 算力中心规划与建设(核心职责) — Lead 大模型训练/推理场景下的算力中心端到端建设:包括高性能网络拓扑设计(IB/RoCE 组网方案)、集群组网与超节点架构设计、服务器选型规划,从源头规避系统性故障风险,交付高可用、高性能的 AI 基础设施
2. 平台与硬件持续演进 — 参与 GPU 算力池化与调度、基础设施管理平台(资产/容量/故障自愈/可观测性)建设,跟踪 GPU/网络/存储技术演进并推动硬件选型与架构优化,持续降低 TCO
任职要求
1. 5 年以上云计算/IDC/服务器硬件/网络基础设施相关经验,深入理解计算机体系结构
2. 在以下方向中至少一个有深入的设计或研发经验:GPU 服务器架构设计、高速网络(IB/RoCE/NVLink/NVSwitch)、交换机研发、超节点架构设计
3. 熟悉主流 AI 训练/推理基础设施生态(NVIDIA DGX/HGX/GB200 NVL、集合通信、NCCL 等),了解大模型训练对基础设施的核心需求
4. 具备跨团队项目推动经验和良好的沟通领导力,能协调硬件、网络、软件等多方团队
加分项
1. 有万卡级 AI 算力集群的规划、建设或运营经验,主导过算力中心从 0 到 1 的落地
2. 有交换机研发、超节点架构设计、或服务器整机架构设计经验
3. 有新一代 AI 芯片/加速卡的适配设计经验(如华为昇腾/海思、国产 GPU 等)
4. 有头部云厂商或 AI 公司基础设施团队背景
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。