招聘公告 · 职位检索 · 央国企/事业单位/名企

资深VLM大模型算法工程师

单位:千寻智能类别:机器学习类型:社招地点:北京、杭州更新:2026-09-24

岗位信息

招聘单位千寻智能
工作地点北京、杭州
官方更新时间2026-05-19 20:55:46

职位描述

我们聚焦具身智能领域前沿技术研发,打造具备自主感知、决策、执行能力的通用智能体系统,现面向行业招募核心技术人才。本次招聘的资深 VLM 多模态大模型工程师,将作为团队技术核心,主导具身智能 Agent 系统核心视觉语言大模型的全链路优化与迭代,直接决定智能体对物理世界的感知理解能力、自主决策能力与任务落地效果,是具身智能系统研发的核心技术岗位。

【核心职责】

1、负责具身智能 Agent 系统核心 VLM 多模态大模型的架构优化、算法迭代与性能提升,针对物理场景感知、机器人交互、自主决策等垂直场景完成模型定制化适配与轻量化落地。

2、主导 VLM 模型在物理世界三维感知、场景语义理解、多模态信息融合、长程时序推理等核心能力的技术攻关,解决真实物理环境下的视觉遮挡、动态干扰、跨场景泛化等行业难题。

3、协同机器人控制、算法工程、产品落地团队,完成 VLM 模型与具身智能系统的深度耦合、端侧部署与工程化优化,保障模型在真实场景下的实时性、稳定性与鲁棒性。

4、跟踪具身智能、多模态大模型领域国际顶会(ICRA、IROS、RSS、CVPR、ICML 等)前沿技术,完成技术预研、方案验证与专利、论文沉淀,搭建团队核心技术壁垒。

5、负责模型训练、微调、评测体系的搭建与优化,制定多模态感知、具身决策能力的量化评测标准,持续迭代模型核心性能指标。

任职要求

【任职要求】

1、计算机/AI 基础: 计算机科学或相关专业硕士及以上学历,具备极强的学术科研与Python/Pytorch工程实现能力,具备扎实的算法推导与问题排查能力。

2、精通视觉 - 语言多模态大模型的核心原理、架构设计与训练流程,熟练掌握 CLIP、BLIP、LLaVA、Qwen-VL 等主流多模态模型的源码解读、微调优化与二次开发。

3、时延优化经验:深刻理解 Transformer 推理瓶颈,有处理多模态大模型(VLM)首 Token 延迟(TTFT)优化的成功案例,具备vLLM / SGLang等推理加速框架的实战经验。

4、熟悉具身智能 Agent 系统基本架构,理解物理世界交互、时序任务规划、闭环决策的核心逻辑,能够基于 VLM 模型完成智能体感知与决策模块的方案设计。

5、具备良好的代码规范、工程化思维与问题解决能力,能够独立负责核心模块的研发与迭代,具备优秀的团队协作与沟通能力。

6、具备良好的英文文献阅读与技术拆解能力,能够快速跟踪、复现与落地前沿多模态与具身智能技术。

7、有高影响力AI企业核心技术研发经验,能够承受技术攻关节奏,具备极强的自驱力与技术创新力。

【加分项】

1、有顶会(CVPR/ICCV/ECCV/ICRA/IROS/RSS/ICML/NeurIPS)第一作者论文,或多模态、具身智能相关发明专利授权成果。

2、主导过落地级具身智能机器人、自主决策 Agent、家用 / 工业智能体产品的 VLM 核心模块研发与量产落地经验。

3、精通大模型轻量化、端侧推理优化、多模态模型与控制算法联合优化,有高实时性、低算力场景模型落地经验。

4、参与过开源多模态大模型、具身智能框架的研发与贡献,有知名开源项目维护经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。