多模态大模型训练工程师(后训练 / 机器人交互方向)
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-05-14 16:16:50 |
职位描述
1. 负责开源大模型在机器人场景下的后训练与能力适配。
2. 负责 SFT、DPO、LoRA / QLoRA、蒸馏等训练实验,完成模型版本迭代与效果分析。
3. 负责结构化输出训练,使模型稳定输出可被运行时消费的字段,例如 `speech_act`、`intent`、`emotion_style`、`route`、`tool_call`、`expression`、`gesture` 等。
4. 参与机器人交互数据构建,包括多轮对话、回应对象、主动交互、澄清确认、情绪表达、端云路由等数据。
5. 参与 preference data、teacher label、hard case 回流数据的构建与质量控制。
6. 与端侧部署工程师协作,支持端侧规格约束下的模型训练、蒸馏、结构化输出稳定性和量化敏感性验证。
7. 与评测工程师协作,根据 gold set、hard case、shadow eval 和版本回归结果持续优化模型。
8. 支持 Demo 的模型能力建设与版本冻结。
任职要求
1. 本科及以上学历,计算机、人工智能、软件工程、自动化、机器人、电子信息等相关专业优先。
2. 3 年以上 LLM / MLLM / NLP / 多模态模型训练或相关算法经验。
3. 熟悉 PyTorch、HuggingFace Transformers、DeepSpeed、Accelerate、vLLM 等至少部分训练 / 推理框架。
4. 熟悉 SFT、LoRA / QLoRA、DPO、RLHF、蒸馏、指令微调等至少两类后训练方法。
5. 具备较强的数据意识,能围绕任务目标设计训练数据、偏好数据、teacher label 和评测 case。
6. 能独立完成训练实验设计、checkpoint 管理、指标对比、case 分析和复现实验。
7. 对机器人交互、多模态输入、结构化输出和端侧模型落地有兴趣。
加分项
1. 做过 Qwen、LLaMA、InternVL、MiniCPM、LLaVA、Qwen-Audio、Qwen-Omni 等开源模型微调。
2. 做过多模态模型训练,尤其是 audio / video / image / text 相关任务。
3. 做过结构化输出、tool calling、function calling、JSON schema 约束训练。
4. 做过 DPO / RLHF / reward model / preference data 构造。
5. 做过 Agent、router、planner、多轮对话、语音助手、智能座舱、数字人或机器人项目。
6. 做过 active speaker、addressed-to-robot、turn-taking、engagement、speaker attribution 等任务。
7. 做过模型蒸馏、端侧小模型训练、量化感知训练或压缩相关工作。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。