VLA后训练算法工程师(具身)(J12674)
岗位信息
| 招聘单位 | 普渡机器人 |
|---|---|
| 工作地点 | 深圳市 |
| 官方更新时间 | 2026-06-23T11:03:42 |
职位描述
1、负责具身智能基座模型微调以及 RL 后训练流程搭建与优化(VLA 模型 /世界模型+ 机器人策略学习),对策略成功率与跨平台泛化性负责
2、跟进 VLA / 机器人策略学习前沿研究(Rlinf/ π0.5/ π0.7 / RL100 / ConRFT 等),完成论文复现与真机 / 仿真环境实验报告
3、负责机器人真机RL数据策略设计、reward shaping(任务成功 + 过程奖励)、online/offline训练和真机实验
4、跟踪训练关键指标(success rate / KL 漂移 / 跨平台泛化 ),定位训练不稳定 / 跨平台失败等常见问题
5、协助业务方对接真实机器人场景,交付和部署可稳定执行的操作模型
任职要求
1、计算机 / 自动化 / 机器人 / 机械电子等相关专业硕士在读,27 / 28 届优先
2、熟悉 Transformer / 扩散策略 / Diffusion Policy 等 VLA 主流架构,深入理解 PPO / GRPO / DPO / IQL / CQL 等至少一种 RL 后训练算法
3、熟练使用 PyTorch / Isaac Sim / MuJoCo / ROS,有 Hugging Face / vLLM / DeepSpeed / Verl 等框架经验者优先
4、有真实机器人 / 仿真环境(Isaac Gym / MuJoCo / Genesis / Isaac Lab)实操经验者优先
5、目标导向、进取当责、良好的学习能力与团队协作精神
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。