招聘公告 · 职位检索 · 央国企/事业单位/名企

大语言模型后训练/Agentic算法工程师

单位:蔚来类型:社招地点:上海、北京更新:2026-09-24

岗位信息

招聘单位蔚来
工作地点上海、北京
经验要求1
官方更新时间2026-05-18 18:59:24

职位描述

岗位亮点

参与构建面向智能座舱场景的下一代大模型 Agent,推动 LLM 后训练、Agentic RL、多工具调用、多轮推理决策等前沿技术在真实车载产品中落地,持续提升模型在真实用户、真实车辆、真实场景中的可靠性与体验。

面向智能座舱与车载交互场景,探索大语言模型与 Agent 在真实产品中的应用,负责车载对话系统、任务型助手、多轮交互Agent等方向的研究、训练优化、效果评估与产品迭代。

跟踪并复现 LLM 后训练与 Agentic Training 前沿技术,包括 On-policy Distillation、Agentic RL、RLHF / RLVR 等,推动其在车载智能体、复杂任务执行、多工具调用和多轮推理决策中的落地。

参与构建 Agent 能力增强所需的训练与交互环境,包括 Tool 系统、User Simulator、World Model、Reward Function、Agent Harness、任务编排与自动化评测框架等。

基于实车交互数据和线上反馈,进行问题挖掘、错误归因与方案优化,建设数据生产、模型训练、离线评测、在线分析和失败案例回流的闭环体系,推动大模型能力从“可用”走向“好用、可靠、可持续进化”。

任职要求

研究生及以上学历,计算机、人工智能、自动化、信号处理、数学等相关专业,具备扎实的机器学习与 NLP 基础。

具备 2 年以上 LLM 后训练相关科研或项目经验,熟悉 Reward Modeling、Preference Learning、On-policy Distillation、RLHF / RLVR 等训练流程。

熟练掌握 Python、Java、TypeScript、JsonScript 等至少一门编程语言,具备良好的工程实现能力。

熟悉 LLM Agent 与 Agent Harness 技术体系,理解 ReAct、Function Calling、Tool Integrated Reasoning、Reflection、Memory、Planning、多轮交互等范式。

熟悉 PPO、GRPO、DAPO 等 LLM RL 算法原理,了解 Agentic RL、长程任务学习、稀疏奖励建模、轨迹级优化等方向。

熟悉 Verl、Slime、ms-swift、OpenRLHF、TRL 等训练或强化学习框架,了解分布式训练、推理服务和评测 infra 者优先。

具备较强的论文跟踪、技术复现和工程落地能力,有车载语音助手、智能座舱、Voice Agent、多模态交互、高水平论文或开源项目经验者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。