后训练工程师
岗位信息
| 招聘单位 | 众擎机器人 |
|---|---|
| 工作地点 | 深圳 |
| 官方更新时间 | 2026-06-19 18:11:10 |
职位描述
1、负责VLA/多模态大模型后训练方法的探索与研究,包括监督微调、RLHF、RLVR、DPO等对齐技术的算法改进与创新;
2、设计并实现高效的后训练实验框架,探索不同后训练策略对模型泛化性、鲁棒性及任务成功率的影响规律;
3、研究模型在具身任务中的行为对齐问题,包括指令遵循、安全约束、偏好对齐等,推动模型行为更符合真实场景需求;
4、探索自动化后训练数据构建方法,包括高质量指令数据的生成、筛选与增强,降低后训练对人工标注的依赖;
5、跟踪CoRL、ICRA、NeurIPS等顶会中具身智能、后训练对齐相关方向的前沿进展,将有效算法快速实验验证并沉淀为团队技术资产;
6、建立后训练效果的评估体系,设计科学的评测基准与实验范式,量化分析不同后训练方法的优劣与适用边界。
任职要求
1、计算机、人工智能、自动化、机器人等相关专业硕士及以上学历,博士优先;
2、3年以上深度学习或强化学习研究经验,有VLA/多模态模型训练或后训练项目经验者优先;
3、精通Python及PyTorch,熟悉DeepSpeed、Megatron等分布式训练框架,具备良好的工程实现能力;
4、深入理解RLHF、PPO、DPO等对齐算法原理,有相关算法实现或改进经验者优先;
5、熟悉大模型SFT、指令微调等技术,了解数据构建与质量对后训练效果的影响;
6、具备较强的科研能力与创新思维,能够独立提出并验证新的后训练方法;
7、在ICML、NeurIPS、ICLR、RSS、CoRL等顶会以第一作者发表过论文者优先;
8、具备良好的沟通表达与团队协作能力,能够与预训练、数据、评测等团队高效配合。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。