招聘公告 · 职位检索 · 央国企/事业单位/名企

GPU集群运维工程师(J10808)

单位:摩尔线程类型:社招地点:北京市更新:2026-09-24

岗位信息

招聘单位摩尔线程
工作地点北京市
官方更新时间2026-02-26T17:21:24

职位描述

1. GPU集群全栈运维实施

● 负责大规模GPU集群的日常运维,涵盖GPU服务器硬件、高速网络、集群存储及Kubernetes容器平台的稳定运行。

● 负责GPU集群的部署实施:从上架验收、网络配置、存储挂载、k8s容器平台部署的全流程实施

● 建立并维护运维规范:编写GPU故障处理手册、网络连通性测试标准、存储性能基线等

2. 监控告警与故障响应

● 构建集群监控体系:部署监控GPU运行状态;配置IB/RoCE网络流量监控;搭建存储健康状态看板等

● On-Call响应:处理训练任务异常中断,执行紧急故障隔离等

● 故障定位:报告GPU硬件、网络/存储、服务器等故障,配合SRE团队输出故障分析方案

3. 平台工具与效能优化

● 开发运维自动化脚本,实现批量节点巡检与故障分析,优化资源交付效率

● 集群容量与成本管理:监控GPU利用率、存储水位增长,定期输出资源使用报告,协助制定扩容方案

任职要求

● 学历与经验: 本科及以上学历,3年以上Linux系统运维经验,1年以上GPU集群或HPC环境运维背景

● 硬件技能: 熟悉GPU服务器架构,具备NVIDIA GPU或国产AI芯片运维经验,能独立处理GPU故障

● 网络技术: 熟练掌握RDMA网络(InfiniBand或RoCEv2),熟练进行网络健康检查;理解Spine-Leaf架构,具备拥塞排查能力

● 存储系统: 熟悉大规模并行文件系统的运维调优

● 云原生与自动化: 熟练使用Kubernetes,掌握Ansible等自动化配置管理,具备Python/Shell脚本开发能力(能独立完成运维工具开发)

● 故障应急能力: 具备高强度On-Call抗压素质,能在大规模训练任务场景下快速定位故障层级,执行紧急恢复操作

● 跨团队协作: 具备与SRE团队、硬件厂商及云平台团队的高效沟通能力,能准确描述技术现象并推动解决

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。