【大模型北斗实习】大规模 Post-training 算法架构前沿研究
岗位信息
| 招聘单位 | 美团 |
|---|---|
| 工作地点 | 北京市、上海市 |
| 官方更新时间 | 1747963941000 |
职位描述
Post-training 是提升大模型专项能力的核心技术方向之一,包括不限于复杂推理(Reasoning)、价值观对齐(Alignment)、业务Agent应用等研究方向。
本课题研究方向包括但不限于:
1)实现高效灵活的多模型强化学习训练架构。
2)通过合理灵活动态配置资源,提升PPO及各变种算法运行效率。
3)研究低精度在 Post-training 中的应用方式。
4)研究不同的算法+数据对效果的影响。
5)在复杂框架下,研究如何高效的追踪记录训练过程,提升算法探索效率。
任职要求
1)熟悉大规模分布式训练、推理、量化等技术之一。
2)熟悉常用的训练推理框架,vLLM、SGLang、Megatron、Deepspeed等。
3)熟悉强化学习算法。
加分项:相关领域开源项目或发表高水平论文。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。