GPU集群运维工程师(J10808)
岗位信息
| 招聘单位 | 摩尔线程 |
|---|---|
| 工作地点 | 北京市 |
| 官方更新时间 | 2026-02-26T17:21:24 |
职位描述
1. GPU集群全栈运维实施
● 负责大规模GPU集群的日常运维,涵盖GPU服务器硬件、高速网络、集群存储及Kubernetes容器平台的稳定运行。
● 负责GPU集群的部署实施:从上架验收、网络配置、存储挂载、k8s容器平台部署的全流程实施
● 建立并维护运维规范:编写GPU故障处理手册、网络连通性测试标准、存储性能基线等
2. 监控告警与故障响应
● 构建集群监控体系:部署监控GPU运行状态;配置IB/RoCE网络流量监控;搭建存储健康状态看板等
● On-Call响应:处理训练任务异常中断,执行紧急故障隔离等
● 故障定位:报告GPU硬件、网络/存储、服务器等故障,配合SRE团队输出故障分析方案
3. 平台工具与效能优化
● 开发运维自动化脚本,实现批量节点巡检与故障分析,优化资源交付效率
● 集群容量与成本管理:监控GPU利用率、存储水位增长,定期输出资源使用报告,协助制定扩容方案
任职要求
● 学历与经验: 本科及以上学历,3年以上Linux系统运维经验,1年以上GPU集群或HPC环境运维背景
● 硬件技能: 熟悉GPU服务器架构,具备NVIDIA GPU或国产AI芯片运维经验,能独立处理GPU故障
● 网络技术: 熟练掌握RDMA网络(InfiniBand或RoCEv2),熟练进行网络健康检查;理解Spine-Leaf架构,具备拥塞排查能力
● 存储系统: 熟悉大规模并行文件系统的运维调优
● 云原生与自动化: 熟练使用Kubernetes,掌握Ansible等自动化配置管理,具备Python/Shell脚本开发能力(能独立完成运维工具开发)
● 故障应急能力: 具备高强度On-Call抗压素质,能在大规模训练任务场景下快速定位故障层级,执行紧急恢复操作
● 跨团队协作: 具备与SRE团队、硬件厂商及云平台团队的高效沟通能力,能准确描述技术现象并推动解决
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。