一段式端到端强化学习算法高级专家/负责人-【自动驾驶】(J21747)
岗位信息
| 招聘单位 | 哈啰出行 |
|---|---|
| 工作地点 | 北京市、上海市 |
| 官方更新时间 | 2026-09-18T18:48:58 |
职位描述
1、在一段式端到端模型完成模仿学习训练后,针对安全防护、多智能体博弈、居中性等任务,通过强化学习进行后训练迭代优化;
2、负责RL算法体系搭建与迭代,带领小组完成模型训练、模型评测、实车落地全流程;
3、沉淀技术成果,推动团队技术标准化、体系化建设。
任职要求
1、本科及以上学历,2年以上自动驾驶模仿学习、强化学习落地经验;
2、主导过RL算法从框架设计选型、模型训练到实车落地的全过程,熟悉OpenRLHF、FM GRPO等框架;
3、熟悉一段式端到端模型的常见结构,有一段式端到端模型落地经验;
4、熟悉常见RL的Reward设计方案,对各类reward可能会带来的问题、避免其他场景退化等方面有处理经验;
5、有头部智驾公司核心项目经验、顶会论文或知名开源项目者优先。
团队福利:
完整L4落地场景+海量真实数据+万卡算力支持、算法快速上车验证、技术氛围纯粹、弹性工作制、完善薪酬期权体系。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。