混元多模态强化学习(RL)算法研究员(北京/上海)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | TEG |
| 所属产品 | AI |
| 工作地点 | 深圳 |
| 经验要求 | 两年以上工作经验 |
| 官方更新时间 | 2026年08月17日 |
职位描述
1.针对多模态模型开展强化学习算法研究,包括面向图像、视频生成的扩散模型,面向多模态理解的自回归模型,以及前沿统一多模态框架;
2.设计并开发强化学习训练框架与奖励建模策略,实现高效的大规模训练,提升训练稳定性,并解决奖励作弊等相关问题;
3.探索下一代强化学习范式,使其能更直接、更高效地从环境反馈中学习。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。