多模态后训练算法
岗位信息
| 招聘单位 | 面壁智能 |
|---|---|
| 工作地点 | 北京、深圳、上海、成都 |
| 官方更新时间 | 2026-09-20 15:25:48 |
职位描述
1、负责多模态大模型的后训练体系建设,包括监督微调(SFT)、强化学习(RLVR/RLHF/RLAIF)、同策略蒸馏(OPD)全流程研发;
2、设计和构建高质量多模态训练数据,包括通用感知、复杂推理、安全对齐数据等,提升模型在真实任务上的表现;
3、改进多模态模型后训练算法和训练范式,驱动多模态大模型的效率/效果持续迭代;
4、跟踪学术界和工业界最新后训练技术,快速验证并落地到 MiniCPM 系列模型中。
任职要求
1、熟悉多模态大模型架构,理解大模型预训练、后训练全流程;
2、有大模型后训练实战经验,熟悉 SFT、DPO/PPO/GRPO 等主流对齐算法;
3、有大模型训练实战经验,熟悉分布式训练框架(DeepSpeed/Megatron 等);
4、具备良好的数据敏感度,能够设计和构建高质量训练数据;
5、有较强的论文阅读和复现能力,跟踪最新技术进展。
加分项
1、有多模态大模型后训练经验,熟悉 MiniCPM-V、Qwen-VL、LLaVA、InternVL 等开源项目
2、有 RLHF/RLVR 从数据构造和奖励构建到训练的完整落地经验
3、有开源社区贡献经验,对知名多模态项目有 PR 贡献
4、熟悉多模上下文管理,多模智能体 benchmark
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。