AI 服务器集群运维 & 本地大模型部署专家-XA(J11722)
岗位信息
| 招聘单位 | 晶晨半导体 |
|---|---|
| 工作地点 | 西安市 |
| 官方更新时间 | 2026-09-14T14:54:08 |
职位描述
岗位职责:
1. 负责 GPU 服务器集群的搭建、监控、日常运维、故障处理,管理多卡算力资源,保障集群稳定;
2. 本地私有化部署开源大模型,搭建推理、微调环境,使用 vLLM 等框架做推理服务,进行量化、并行性能调优;
3. 维护 Linux、CUDA、Docker 环境,使用 Slurm/K8s 做算力调度,编写运维 SOP 和部署文档;
4. 和算法团队配合,解决训练、推理阶段底层算力和环境问题,规划算力扩容。
任职要求
任职要求:
1. 3 年以上 GPU 集群运维 + 大模型本地部署经验;精通 Linux、Docker;熟悉 CUDA、NCCL;
2. 熟悉 Slurm 或 K8s 算力调度,熟悉 GPU 监控,能排查硬件、网络、显存故障;
3. 实战落地过本地大模型推理,掌握模型量化、推理加速;有 LoRA 微调环境搭建经验优先;
4. 能写 Shell/Python 脚本,具备独立问题排查能力。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。