混元大语言模型后训练算法工程师-RM方向(北京/深圳/上海)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | TEG |
| 所属产品 | 混元-模型算法 |
| 工作地点 | 北京 |
| 经验要求 | 一年以上工作经验 |
| 官方更新时间 | 2026年08月20日 |
职位描述
1.负责大语言模型后训练(Post-Training)阶段的核心技术研发,构建和优化高质量的奖励系统(Reward System),通过Reward Modeling (RM) 和强化学习(RL)算法持续提升模型在复杂指令遵循、逻辑推理及价值观对齐方面的能力;
2.深入研究和优化 RLHF 等后训练算法,提升模型训练的稳定性和最终效果;
3.负责大模型个性化(Personalization)与长期记忆(Memory)机制的算法研发,构建精准的“千人千面”用户建模体系,探索模型如何理解、提取、记忆并动态适应不同用户的长期偏好,持续提升个性化交互体验;
4.负责后训练阶段的数据合成与管理,设计高效的数据飞轮机制,利用SFT、Self-Instruct等技术合成高质量训练数据,并负责建立从用户多维反馈(User Feedback)到模型迭代的闭环信号建模体系;
5.负责后训练模型的全维度评测与分析,制定科学的评价指标,跟进前沿技术动态,将最新研究成果快速转化为业务价值。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。