强化学习实习生(认知计算团队)
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海、北京 |
| 经验要求 | 1 |
| 官方更新时间 | 2025-10-17 19:50:44 |
职位描述
负责强化学习算法的研究与开发,包括但不限于PPO、DPO、GRPO、DAPO等算法;
构建仿真环境,设计奖励机制,训练并调优智能体策略;
与产品和工程团队紧密合作,将RL算法落地到实际业务场景;
跟踪学术界和工业界最新RL研究进展,持续优化模型性能与训练效率;
撰写技术文档,参与代码评审,推动团队技术能力提升。
任职要求
计算机、人工智能、自动化、数学等相关专业硕士及以上学历;
扎实的强化学习理论基础,熟悉MDP、Bellman方程、策略梯度、值函数逼近等核心概念;
熟练掌握Python,熟悉PyTorch/TensorFlow等深度学习框架,具备独立实现RL算法的能力;
有强化学习项目经验(如游戏AI、推荐系统、机器人控制、仿真环境训练等)者优先;
具备良好的问题分析能力、团队协作能力和技术沟通能力。
加分项:
在NeurIPS、ICML、ICLR、AAAI等顶会发表过RL相关论文;
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。