自主中心-研究岗/工程技术岗-VLN算法(J10491)
岗位信息
| 招聘单位 | 启元实验室 |
|---|---|
| 工作地点 | 海淀区 |
| 官方更新时间 | 2026-02-27T14:02:06 |
职位描述
1.负责视觉-语言导航(VLN)核心算法的研发,构建具备指令理解与自主决策能力的多模态导航模型;
2.设计和实现融合视觉感知、语言理解与空间推理的跨模态模型架构(如Transformer、多模态LLM、强化学习框架等);
3.探索大模型在VLN任务中的应用,包括预训练、指令微调、多任务学习及RAG增强等策略;
4.构建仿真与真实环境下的VLN训练与评测体系,提升导航成功率(SR)、SPL、NE等核心指标;
5.分析模型在复杂环境(遮挡、动态障碍、长指令、多步推理)中的失效模式,提出改进方案;
6.跟踪CVPR、ICCV、NeurIPS、ICLR等前沿会议在VLN、多模态智能体领域的研究成果,并评估其工程可行性。
任职要求
1.人工智能、电子信息、通信、计算机、自动控制、集成电路等专业硕士/博士/博后,博士/博后优先;
2.精通Python,具备扎实的算法实现能力,熟悉PyTorch等深度学习框架;熟悉Transformer、多模态大模型(如视觉编码器+LLM融合架构)及强化学习基础;
3.熟悉VLN或相关任务(Embodied AI、视觉问答、指令跟随、机器人导航等);
4.理解SLAM、三维空间表示、路径规划等基础原理;
5.具备良好的论文阅读能力与算法复现能力,有独立设计实验的能力。
加分项:
1.熟悉经典VLN数据集(R2R、RxR、VLN-CE等)或具身智能仿真平台(Habitat、Gibson等);
2.熟悉大模型微调(LoRA、QLoRA、SFT、RLHF)或多模态对齐训练;
3.在CV/AI顶会发表论文或有开源项目贡献经验;
4.有真实机器人或无人系统部署经验优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。