大模型领域后训练算法工程师
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 北京、上海 |
| 经验要求 | 1 |
| 官方更新时间 | 2026-04-08 18:17:06 |
职位描述
1. 设计并实现面向车载人机智能交互系统的后训练算法流程,优化多轮对话决策、任务规划等agent能力。
2. 负责调研、复现LLM agentic RL等post-training相关的前沿研究,探索将新技术应用于实际产品。
3. 协助实车数据问题挖掘、分析及解决方案制定等。
4. 协助设计并实现增强基模agent相关能力的交互环境、user simulator、world model、reward function等关键模块。
任职要求
1. 本科及以上学历,计算机、自动化、信号处理等相关专业,数理基础扎实,乐于在强化学习方向深入探索。
2. 熟练掌握Python/JAVA/TypeScript/JsonScript等编程语言(一门及以上)。
3. 熟悉LLM agent相关概念,深入理解ReAct、function call、TIR、reflection等相关范式。
4. 熟练掌握LLM RL主流算法原理,如PPO、GRPO、DAPO等,对agentic RL范式有研究兴趣,有实际项目经验为佳。
5. 熟悉相关蒸馏算法,包括off-policy distillation及on-policy distillation等范式。
6. 熟悉常见后训练、强化学习框架,包括但不限于Verl、Slime、ms-swift、OpenRLHF、TRL等。对大规模分布式机器学习框架有一定了解,对training、inference相关infra工作感兴趣。
7. 熟悉语音对话系统,或有高水平论文发表者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。