招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infra工程师(基础架构)(J12892)

单位:普渡机器人类型:社招地点:深圳市更新:2026-09-24

岗位信息

招聘单位普渡机器人
工作地点深圳市
官方更新时间2026-08-03T16:27:33

职位描述

1. GPU算力集群建设与管理:GPU集群(A100/H100等)选型、采购、部署与运维;建设集群资源调度系统(弹性调度、优先级管理、资源隔离);优化集群利用率

2. 训练基础设施搭建:分布式训练环境(NCCL网络优化、RDMA配置、存储对接);训练任务自动化运维(故障自愈、Checkpoint自动保存与恢复、日志聚合);大规模训练网络拓扑与通信优化

3. 阿里云资源维护与成本优化:阿里云资源日常维护与监控;设计混合云架构(本地+云弹性伸缩);持续优化云资源成本(Spot实例、自动扩缩容)

4. 监控告警与稳定性建设:集群级监控体系;告警策略与故障响应机制;容量规划支撑3-5年算力增长

任职要求

1. 计算机科学、软件工程等相关专业,本科及以上学历,3年以上基础设施/SRE/DevOps经验

2. 熟悉Linux系统、网络(TCP/IP/RDMA)、存储(NFS/Lustre/Ceph)原理与调优

3. 熟悉Kubernetes,有GPU集群调度(Volcano/Yunikorn)或自研调度器经验

4. 熟悉阿里云/AWS/GCP等公有云资源管理,有云成本优化经验

5. 熟悉监控告警体系(Prometheus/Grafana/ELK),有大规模集群运维经验

6. 具备从0到1搭建算力基础设施经验

7. 良好的问题排查能力

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。