招聘公告 · 职位检索 · 央国企/事业单位/名企

AI Infra Engineer(Agentic RL 训练框架)

单位:小鹏汽车类别:互联网 / 电子 / 网游类型:社招地点:深圳、北京、上海更新:2026-09-24

岗位信息

招聘单位小鹏汽车
工作地点深圳、北京、上海
官方更新时间2026-09-14 18:31:08

职位描述

参与机器人大模型强化学习训练框架的研发与优化,面向不同模型、训练方式和业务场景,完善训练与推理能力,提升框架的稳定性、扩展性和运行效率。通过框架开发、性能分析与算法工程协作,支撑大规模强化学习实验和业务训练,推动算法能力高效落地。

【职位描述】

1. 训练框架研发:负责强化学习训练框架的设计、开发与迭代,完善 GRPO、PPO、On-Policy Distillation 等训练方式的完整流程、数值正确性与运行稳定性,统一训练数据、优化目标与参数更新的扩展接口;

2. 核心模块与多后端适配:参与训练、推理、轨迹管理、奖励计算等核心模块研发,推进模块解耦与服务化,完善对 FSDP、Megatron、vLLM、SGLang 等训练与推理后端的适配层,支持不同模型、训练方式和业务场景的接入;

3. 评测与性能优化:建设核心训练场景的 benchmark、profiling 与 CI 回归体系,理解不同训练场景的运行特征,定位影响端到端效率与资源利用率的关键瓶颈,结合真实业务负载开展优化并推动成果落地;

4. 业务训练闭环:与算法团队协作完成具身模型 RL 后训练等真实业务的训练闭环,参与训练需求分析、技术方案设计与联调验证,支持新训练方法的接入与工程化落地;

5. 自动化与研发效能:完善任务配置、实验追溯、排障诊断与模型交付工具及文档,降低实验配置、管理与排障成本,提升框架使用体验与算法研发效率。

任职要求

1. 扎实的 Python 编程与软件工程能力,熟悉 Linux 开发环境,具备良好的代码设计、调试和维护能力;

2. 熟悉 PyTorch,理解大模型训练与推理的基本流程,具有相关框架或基础设施的实际研发经验;

3. 具备分布式训练或推理系统经验,熟悉 FSDP、Megatron、vLLM、SGLang 等框架中的至少一种,能够理解其执行机制并定位实际问题;

4. 具备系统性能分析能力,能够结合 CPU、GPU、内存和通信等运行信息定位瓶颈,并通过实验验证优化效果;

5. 了解强化学习中采样、训练、环境交互和权重更新的关系,能够理解算法需求并转化为合理的工程实现;

6. 具备独立负责模块开发与问题闭环的能力,能够与算法及业务团队有效协作,完成方案设计、开发验证和持续迭代。

【加分项】

1. 有 AReaL、verl、RLinf 等强化学习框架的使用、集成或开发经验;

2. 有训练或推理框架源码开发、多后端适配、分布式通信或显存优化经验;

3. 熟悉 PyTorch Profiler、Nsight 等性能分析工具,或具有 CUDA、Triton、算子优化相关经验;

4. 有多模态、Agentic RL、异步强化学习等场景的工程实践,或有服务化、资源调度和自动调优相关经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。