【基座大模型北斗实习】多模态大模型技术研究
岗位信息
| 招聘单位 | 美团 |
|---|---|
| 工作地点 | 北京市、上海市、深圳市 |
| 官方更新时间 | 1775223030000 |
职位描述
简介:参与多模态大模型方向的前沿研究,可根据个人背景和研究兴趣选择以下方向之一深入推进:
1、多模态预训练与后训练技术创新,提升模型在 OCR、文档图表解析、Visual Grounding、细粒度感知、视觉问答等核心任务上的能力上限。
2、多模态强化学习方案设计,实现视觉感知与多模态理解场景下的高性能可信输出与幻觉抑制。
3、视觉推理能力增强研究(Visual CoT、PRM 等),提升模型在复杂视觉任务上的推理深度。
4、工具调用与 Agent 能力构建,探索多模态模型在规划决策场景中的综合表现。
5、长上下文视觉理解与 GUI 能力研究,提升模型在长程复杂任务上的综合能力。
6、其他你坚信路线正确的多模态大模型前沿方向。
任职要求
1、具备视觉多模态大模型的预训练或后训练研究经历;
2、熟悉PyTorch,有充分的动手实践经验。
加分项:
1、社区影响力:在多模态大模型领域有影响力的开源项目中做出过核心贡献;
2、学术影响力:发表过高水平论文(如ICLR、CVPR、ICCV等),有相关竞赛经历并取得名次。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。