混元多模态强化学习后训练算法工程师(框架协同方向)(北京/上海)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | TEG |
| 所属产品 | AI |
| 工作地点 | 深圳 |
| 经验要求 | 三年以上工作经验 |
| 官方更新时间 | 2026年08月14日 |
职位描述
1.算法-框架协同设计:作为算法与框架团队之间的技术桥梁,深入理解多模态大模型后训练算法(如RLHF、DPO、课程强化学习等)的原理与演进趋势,并将其转化为对底层框架的功能需求,为框架架构设计建言献策;
2.训练流程优化与评测:主导或深度参与后训练流程(如多模态SFT、RLHF)的搭建、优化与效果评测。关注训练稳定性、效率及泛化能力,特别是针对跨模态对齐、奖励函数设计及策略优化等环节提出系统性改进方案;
3.技术调研与瓶颈攻关:主动跟踪学术界与工业界在多模态强化学习后训练领域的前沿进展。针对训练中出现的瓶颈(如OOD泛化不足;
4.模态融合冲突等),进行根因分析,并与框架团队协作制定解决方案;
5.跨团队支持与知识沉淀:高效协同框架开发、硬件优化及业务算法团队,确保技术方案落地。撰写高质量的技术文档、设计稿与实验报告,并组织内部分享,推动团队整体技术认知提升。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。