AI Infra工程师(基础架构)(J12892)
岗位信息
| 招聘单位 | 普渡机器人 |
|---|---|
| 工作地点 | 深圳市 |
| 官方更新时间 | 2026-08-03T16:27:33 |
职位描述
1. GPU算力集群建设与管理:GPU集群(A100/H100等)选型、采购、部署与运维;建设集群资源调度系统(弹性调度、优先级管理、资源隔离);优化集群利用率
2. 训练基础设施搭建:分布式训练环境(NCCL网络优化、RDMA配置、存储对接);训练任务自动化运维(故障自愈、Checkpoint自动保存与恢复、日志聚合);大规模训练网络拓扑与通信优化
3. 阿里云资源维护与成本优化:阿里云资源日常维护与监控;设计混合云架构(本地+云弹性伸缩);持续优化云资源成本(Spot实例、自动扩缩容)
4. 监控告警与稳定性建设:集群级监控体系;告警策略与故障响应机制;容量规划支撑3-5年算力增长
任职要求
1. 计算机科学、软件工程等相关专业,本科及以上学历,3年以上基础设施/SRE/DevOps经验
2. 熟悉Linux系统、网络(TCP/IP/RDMA)、存储(NFS/Lustre/Ceph)原理与调优
3. 熟悉Kubernetes,有GPU集群调度(Volcano/Yunikorn)或自研调度器经验
4. 熟悉阿里云/AWS/GCP等公有云资源管理,有云成本优化经验
5. 熟悉监控告警体系(Prometheus/Grafana/ELK),有大规模集群运维经验
6. 具备从0到1搭建算力基础设施经验
7. 良好的问题排查能力
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。