机器人轨迹寻优工程师
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海 |
| 经验要求 | 5 |
| 官方更新时间 | 2026-09-24 14:42:15 |
职位描述
一、强化学习算法研发与落地(50%)
主导机器人轨迹寻优方向强化学习算法的设计、训练与调优,覆盖 PPO、SAC、TD3、DQN 等主流算法。
负责奖励函数、状态空间与动作空间的建模设计,针对复杂环境下的轨迹寻优任务持续迭代算法方案。
负责仿真实验体系搭建,包括并行环境采样、分布式训练、实验数据管理与训练曲线分析。
跟踪强化学习与机器人领域前沿进展,推动新方法(如多任务 RL、离线 RL、世界模型等)在业务场景中的探索与落地。
参与技术方案评审与组内技术分享,输出高质量技术文档与实验报告。
二、全栈系统开发与工程化(35%)
负责机器人轨迹寻优平台的整体架构设计与核心模块开发,包括训练任务管理、实验配置、可视化监控等。
负责后端服务开发(API、任务调度、数据存储),支撑大规模算法训练与推理运行。
负责前端可视化界面开发(训练曲线、轨迹回放、参数配置面板),提升算法调试与实验效率。
负责算法模块与 ROS / 仿真环境的对接、部署与性能优化,保障系统稳定性与可扩展性。
推动训练平台的工程化建设,包括 CI/CD、容器化部署、实验跟踪与模型版本管理。
三、团队协作与技术引领(15%)
参与代码评审,推动团队工程规范与代码质量建设。
指导初级工程师与实习生,参与团队技术能力培养。
与算法、硬件、产品团队紧密协作,理解技术落地的完整链路,推动项目按期交付。
持续学习强化学习与机器人前沿知识,带动团队技术氛围。
任职要求
必备条件
学历背景:计算机、自动化、机器人、人工智能、数学等相关专业本科及以上学历。
工作经验:3 年以上强化学习 / 机器人算法 / 运动规划相关工作经验。
算法能力:精通主流强化学习算法(PPO、SAC、TD3、DQN 等)的原理与实现,具备独立设计算法方案并推动落地的能力。
工程能力:熟练掌握 Python,精通 PyTorch 或 TensorFlow 等深度学习框架,具备大规模训练与调优经验。
机器人背景:熟悉机器人运动学、动力学基础,具备 ROS / Gazebo / MuJoCo / Isaac Sim 等仿真环境的实际项目经验。
全栈能力:具备后端(FastAPI / Flask / Django 等)或前端(React / Vue 等)开发经验,能够独立完成模块设计与开发。
落地经验:具备从仿真训练到真机部署的完整项目经验,熟悉 sim-to-real 迁移的常见方法与挑战。
工程素养:具备良好的代码习惯、文档意识、架构思维与团队协作能力。
学习能力:对强化学习与机器人方向有持续热情,能够快速跟进前沿进展并转化为工程实践。
加分项
有机器人轨迹规划、运动控制、抓取操作等相关项目的完整落地经验。
有分布式训练、大规模并行仿真、强化学习工程化框架(RLlib、Stable-Baselines3 等)的深度使用经验。
在顶会(NeurIPS、ICML、ICLR、CoRL、RSS、ICRA 等)发表过相关论文。
有开源项目贡献或高质量技术博客输出。
有指导初级工程师或带小团队的经验。
熟悉 C++ / CUDA,具备高性能计算与实时系统开发经验。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。