AI infra平台开发工程师
岗位信息
| 招聘单位 | 众擎机器人 |
|---|---|
| 工作地点 | 深圳 |
| 官方更新时间 | 2026-05-16 10:35:54 |
职位描述
1、负责公司算力平台的全栈开发,涵盖算力资源调度、云端训练与推理引擎构建、分布式存储等核心模块;
2、设计与实现高性能、可扩展的算力调度系统,支持千卡级GPU集群的统一管理与动态资源分配;
3、构建云端分布式训练与推理引擎,优化大模型训练、微调及推理服务的效率与稳定性;
4、参与平台整体架构设计,推动系统高可用、可扩展性及自动化能力建设;
5、优化GPU集群的利用率与通信效率,包括NCCL/IB/RoCE等网络性能调优;
6、构建训练任务的生命周期管理能力,支持任务排队、优先级调度、弹性伸缩与故障自动恢复;
7、与算法团队协作,理解大模型训练与推理的工作负载特征,持续优化平台性能与资源效率。
任职要求
1、本科及以上学历,计算机、软件工程、人工智能等相关专业;
2、3年以上AI基础设施、云计算或分布式系统开发经验,具备从0到1搭建算力平台经验者优先;
3、精通至少一种后端开发语言(Go/Python/Java),具备扎实的工程化能力与系统设计思维;
4、熟悉容器化技术及资源调度框架,有千卡级以上GPU集群的资源调度与优化经验;
5、了解分布式训练框架及推理引擎,有相关集成优化经验者优先;
6、熟悉高性能网络及GPU通信原理,有相关调优经验者优先;
7、了解分布式存储及并行文件系统,有AI训练数据加速经验者优先;
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。