算力与平台建设工程师-人工智能事业部南京基地(J12020)
岗位信息
| 招聘单位 | 中国钢研 |
|---|---|
| 工作地点 | 南京市 |
| 官方更新时间 | 2026-05-06T10:30:15 |
职位描述
1. 负责 GPU 服务器、容器平台、训练环境、推理环境和存储网络的建设与运维,支撑模型训练、推理、数据处理和仿真任务。
2、负责算力平台的网络与资源调度体系,优化算力资源分配策略,提升算力利用率与平台运行效率。
3、负责冶金数据平台、模型训练平台、仿真平台的搭建与集成,实现各平台与算力平台的互联互通与协同运行。
4、监控算力与各平台的运行状态,及时排查硬件故障、网络问题、软件漏洞,制定应急预案,保障平台高可用性与安全性。
5、制定算力与平台的维护、升级计划,跟踪算力与平台技术前沿,提出技术迭代建议,做好算力资源成本管控。
任职要求
【必备】
1. 3年以上 Linux、容器平台、集群运维或 AI Infra 经验。
2. 熟悉 Docker、Kubernetes、GPU 环境、网络存储、脚本自动化、Prometheus/Grafana 等工具;能独立处理常见性能与故障问题。
3. 有训练平台、资源调度、分布式存储、镜像管理、CI/CD 或平台化建设经验。
【优先】
1. 有 Slurm、Kubeflow、Argo、Volcano、Ray、MLOps/LLMOps 经验。
2. 有科研算力平台、国央企私有化平台或工业 AI 平台经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。