狮子山实验室-具身智能多模态算法工程师(机器人方向)(J33428)
岗位信息
| 招聘单位 | 中国长航 |
|---|---|
| 工作地点 | 深圳市 |
| 官方更新时间 | 2026-09-02T14:14:28 |
职位描述
1. 负责多模态大模型、视觉语言模型、视觉语言导航和具身智能相关算法在机器人系统中的技术规划、方案设计与工程化落地,支撑四足机器人、轮足机器人、巡检机器人等产品的智能交互、环境理解和自主任务执行能力。
2. 负责机器人多模态智能系统的整体架构设计,构建“语言指令理解—视觉场景理解—任务规划—技能调用—执行反馈—异常恢复”的高层决策链路。
3. 负责 VLM / VLN / Agent / Grounding / VLA 等方向的技术选型、模型评估和落地方案设计,判断开源模型、闭源 API、本地部署模型在机器人业务中的适用性、成本和风险。
4. 负责视觉语言导航、目标导航、图像目标点导航、语言指令导航等核心能力建设,将用户语音、文本指令、图像点选 / 框选、目标描述等交互输入转化为机器人可执行的导航目标或任务策略。
5. 负责多模态模型与机器人导航、建图定位、视觉感知、智能跟随、巡检任务、任务调度等模块的融合设计,推动多模态能力从 Demo 验证走向可复用、可维护、可交付的产品模块。
6. 负责开放词汇感知、目标定位、目标确认、场景问答、异常事件复核、任务状态判断等机器人多模态能力建设,提升机器人在开放场景下的理解和决策能力。
7. 负责机器人技能系统设计,将导航、跟随、巡检、拍照、识别、问答、回充等能力封装为大模型可调用的结构化工具或 Skill,并设计任务编排、状态反馈和异常兜底机制。
8. 负责多模态算法在端侧、边缘端、云端的部署策略设计,包括模型选型、推理链路设计、延迟控制、稳定性评估、异常处理、结果校验和长期运行可靠性优化。
9. 负责组织前沿技术调研、论文复现、技术路线评估和原型验证,跟踪具身智能、多模态大模型、视觉语言导航、机器人 Foundation Model、机器人 Agent 等方向的最新进展。
10. 负责关键技术问题攻关、技术方案评审、团队成员指导和跨团队协作,作为多模态机器人方向的技术窗口,与导航定位、视觉算法、工程部署、硬件、产品和现场交付团队协同推进项目落地。
任职要求
1. 硕士及以上学历,计算机、人工智能、机器人、自动化、电子信息、计算机视觉等相关专业,具备 3 年及以上多模态算法、计算机视觉、大模型应用、机器人智能交互或具身智能相关研发经验。
2. 熟悉多模态大模型、视觉语言模型、大语言模型或具身智能相关技术,理解 VLM、LLM、VLN、Grounding、开放词汇检测、图像 / 视频理解、视觉问答、机器人 Agent 等方向的基本原理和技术路线。
3. 具备较强的技术选型和系统架构能力,能够结合机器人业务需求评估模型效果、工程复杂度、部署成本、实时性、稳定性和可交付性。
4. 熟悉至少一种主流多模态或视觉语言模型 / 框架,如 CLIP、BLIP、LLaVA、Qwen-VL、InternVL、GroundingDINO、SAM、Florence、GPT-4o / GPT-4.1、Gemini、Claude、DeepSeek、Qwen 等,有实际项目落地经验者优先。
5. 具备扎实的计算机视觉和深度学习基础,熟悉目标检测、图像分割、目标跟踪、ReID、图像检索、特征匹配、位姿估计、3D 目标定位等一种或多种视觉算法。
6. 熟练掌握 Python,熟悉 PyTorch、Transformers、OpenCV 等常用算法开发工具,具备良好的算法实现、实验分析和工程代码能力。
7. 了解机器人系统基本原理,熟悉 ROS / ROS2、TF、Topic、Service、Action、rosbag、rviz 等常用机制,能够设计多模态算法与机器人系统之间的接口和数据链路。
8. 熟悉 Prompt Engineering、Function Calling、Tool Use、Agent、行为树、任务状态机、技能调度等一种或多种大模型应用开发方法。
9. 具备较强的问题定位和系统调试能力,能够针对机器人真实场景中的幻觉、误识别、延迟过高、目标定位不准、任务理解错误、执行失败等问题制定优化和兜底方案。
10. 具备良好的沟通能力、技术推动能力和团队协作精神,能够带领初级工程师或实习生完成技术验证、模块开发和项目落地。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。