招聘公告 · 职位检索 · 央国企/事业单位/名企

AI infra工程师-集群管理方向

单位:MiniMax类别:基础架构类型:社招地点:北京、上海更新:2026-09-24

岗位信息

招聘单位MiniMax
工作地点北京、上海
官方更新时间2026-07-17 14:41:01

职位描述

一、一句话定位

参与建设服务大模型训练、推理与在线业务的 Kubernetes 集群管理平台,用自动化和软件工程手段解决集群创建、升级、扩缩容、节点管理与稳定性问题,让大规模集群可标准化交付、可观测、可恢复。

二、为什么这个岗位重要

Kubernetes 是承载训练、推理和在线业务的核心基础设施,集群稳定性直接影响业务连续性与研发效率。

随着集群规模和异构资源类型增长,依靠人工操作无法支撑稳定交付,需要把集群生命周期管理做成平台和控制系统。

你将深入 Kubernetes 控制面、节点生命周期与集群可靠性,在真实生产环境中理解大型分布式系统如何运行和演进。

三、你将负责什么

1. 参与研发 K8s 集群管理平台,覆盖集群创建、配置、升级、扩缩容、巡检、回收等生命周期。

2. 基于 Operator / Controller、CRD 和声明式 API 建设自动化控制能力,减少人工操作与环境差异。

3. 参与 apiserver、etcd、scheduler、controller-manager、kubelet 等核心组件的稳定性、容量和性能治理。

4. 建设节点接入、状态管理、故障隔离和恢复能力,并与机器 / 网络底座团队协作完成问题定界。

5. 参与多集群管理、版本治理、配置一致性、变更防护和灾备演练,提升集群服务的标准化与可靠性。

6. 完善集群指标、日志、事件和 SLO,沉淀自动巡检、故障诊断和恢复工具。

任职要求

四、我们期望你具备

1. 计算机、软件工程或相关专业本科及以上学历,具备扎实的计算机基础。

2. 至少熟练掌握 Go、Python、Java、C++ 中一门语言,能够独立完成编码、调试与测试;coding 是硬门槛。

3. 熟悉 Linux、操作系统、计算机网络和分布式系统基础。

4. 理解容器、进程隔离、网络与存储的基本概念,对 Kubernetes 工作机制有学习或实践基础。

5. 重视可靠性和工程质量,遇到故障能形成“发现—止损—定位—恢复—复盘”的基本思路。

6. 有 Owner 意识,愿意与不同技术团队协作完成端到端闭环。

加分项

阅读过 Kubernetes 核心代码,或开发过 Operator / Controller、调度插件、设备插件。

有 Kubernetes 集群搭建、升级、故障排查或多集群项目经历。

熟悉 etcd、容器运行时、CNI、CSI、eBPF 中的一项或多项。

有开源贡献、技术竞赛、优秀课程设计或可展示的分布式系统项目。

对 GPU 集群、大模型训练 / 推理基础设施有兴趣。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。