招聘公告 · 职位检索 · 央国企/事业单位/名企

大规模仿真强化学习实习生

单位:蔚来类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位蔚来
工作地点北京
经验要求1
官方更新时间2025-08-04 14:33:46

职位描述

参与大规模自博弈强化学习训练实验,设计和构建大规模、高吞吐量的批处理仿真器,十亿级仿真训练吞吐的驾驶经验生成 ;并改进 PPO 等高效的在策略(On-Policy)强化学习算法进行大规模训练 。

辅助算法的鲁棒性与泛化性验证。

参与攻坚仿真到现实的迁移 (Sim2Real),参与研究和评估策略的Sim2Real迁移性能,探索域随机化(Domain Randomization)、系统辨识(System ID)等技术,以提升策略对真实世界变化的适应能力。协助团队将训练好的策略部署到真实世界的车辆平台上进行验证。

任职要求

(必要条件)

教育背景: 计算机科学、人工智能、机器人学或相关领域的在读27届及之后毕业的博士/硕士研究生/优秀本科生。

对以下至少两个领域有扎实的知识基础和相关的项目/研究经验:

强化学习: 熟悉多智能体RL、自博弈、PPO、SAC等主流算法。

生成式模型: 熟悉 Diffusion 模型、GANs 等,并有相关实践经验。

Sim2Real: 对仿真到现实的迁移问题有了解或实践经验。

编程与系统能力:

精通 Python 和 PyTorch/Jax,具备训练和调试复杂强化学习算法的能力。

拥有构建或使用高性能、批处理仿真环境(如 Isaac Gym/Lab)的经验 。

具备优秀的系统设计和性能优化能力,熟悉 GPU 编程者优先。

算法知识: 精通 PPO 等主流深度强化学习算法,并理解其在大型分布式系统中的应用 。

加分项(优先条件)

对 GIGAFLOW、AlphaGo 等大规模自博弈领域的里程碑式研究有深入理解者是我们的首选。

在 NeurIPS, ICML, ICLR, CoRL, ICRA 等顶级会议上发表过相关领域论文者。

具备强大的 C/C++ 技能,能够将性能关键的仿真部分从 Python 移植到 C/C++ 以追求极致效率。

有在真实机器人或智能辅助驾驶系统上部署和迁移(Sim-to-Real)强化学习策略的经验 。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。