AI平台运维(AI Infra)
岗位信息
| 招聘单位 | 德赛西威 |
|---|---|
| 工作地点 | 惠州 |
| 官方更新时间 | 2024-12-10 13:53:58 |
职位描述
1.负责GPU集群日常运维:服务器、InfiniBand/RoCE网络、并行存储的部署、监控与故障处理,保障训练/推理业务连续性;
2.基于K8s/Volcano/Slurm落地算力调度策略(分时复用、优先级、配额),持续提升GPU利用率与集群效率;
3.负责大模型部署与推理服务运维(vLLM/Triton等),保障高并发下的稳定性与延迟表现;
4.建设智算平台监控可观测与AIOps能力(故障预测、自动巡检),推动运维自动化;
5.参与算力成本运营(FinOps)与国产算力(昇腾等)适配验证,沉淀运维SOP与知识库。
任职要求
1、本科及以上学历,计算机、通信、电子等相关专业;
2、3年以上云计算或AI基础设施运维经验,有GPU集群(百卡级及以上)实际运维调优经历;
3、熟悉Linux、Kubernetes、Python/Shell自动化,了解NVIDIA生态(CUDA/DCGM/NCCL);
有大模型本地化部署与推理服务运维经验(vLLM/TensorRT-LLM等至少一种生产环境实践);
4、良好的故障定位能力与协作意识,能接受7×24轮值。
加分项
5、千卡级训练集群运维经验;昇腾/海光等国产芯片适配经验;Prometheus/Grafana全链路监控搭建;推理框架开源贡献。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。