招聘公告 · 职位检索 · 央国企/事业单位/名企

AI平台运维(AI Infra)

单位:德赛西威类型:社招地点:惠州更新:2026-09-24

岗位信息

招聘单位德赛西威
工作地点惠州
官方更新时间2024-12-10 13:53:58

职位描述

1.负责GPU集群日常运维:服务器、InfiniBand/RoCE网络、并行存储的部署、监控与故障处理,保障训练/推理业务连续性;

2.基于K8s/Volcano/Slurm落地算力调度策略(分时复用、优先级、配额),持续提升GPU利用率与集群效率;

3.负责大模型部署与推理服务运维(vLLM/Triton等),保障高并发下的稳定性与延迟表现;

4.建设智算平台监控可观测与AIOps能力(故障预测、自动巡检),推动运维自动化;

5.参与算力成本运营(FinOps)与国产算力(昇腾等)适配验证,沉淀运维SOP与知识库。

任职要求

1、本科及以上学历,计算机、通信、电子等相关专业;

2、3年以上云计算或AI基础设施运维经验,有GPU集群(百卡级及以上)实际运维调优经历;

3、熟悉Linux、Kubernetes、Python/Shell自动化,了解NVIDIA生态(CUDA/DCGM/NCCL);

有大模型本地化部署与推理服务运维经验(vLLM/TensorRT-LLM等至少一种生产环境实践);

4、良好的故障定位能力与协作意识,能接受7×24轮值。

加分项

5、千卡级训练集群运维经验;昇腾/海光等国产芯片适配经验;Prometheus/Grafana全链路监控搭建;推理框架开源贡献。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。