混元Agentic Vision算法研究员(北京/上海)(深圳)
岗位信息
| 招聘单位 | 腾讯 |
|---|---|
| 部门/事业群 | TEG |
| 所属产品 | 混元-模型算法 |
| 工作地点 | 北京 |
| 经验要求 | 三年以上工作经验 |
| 官方更新时间 | 2026年08月25日 |
职位描述
1.主导 Visual2Code 能力建设:负责多模态大语言模型在 Visual2Code 方向的核心算法研发,围绕“视觉输入—代码理解—代码生成—执行验证”完整链路,持续提升模型从界面、图表、文档、图像等视觉信息中理解结构并生成高质量代码的能力;
2.建设高质量数据体系:负责 Visual2Code 训练数据的设计、构建与迭代,包括真实数据挖掘、自动化数据合成、难度分层、质量过滤及数据配比等,建立覆盖多场景、多语言、多任务形态的数据生产与数据飞轮体系;
3.推进模型与算法创新:深入探索 Visual2Code 场景下的 SFT、强化学习、代码执行反馈、Verifier/Reward Model 等后训练方法,研究视觉理解、代码推理与执行反馈之间的协同机制,持续提升模型在复杂任务中的正确率、泛化能力与稳定性;
4.强化复杂视觉编程能力:聚焦视觉结构解析、布局理解、图表/文档理解、视觉逻辑推理以及代码生成等关键能力,提升模型从复杂视觉输入中完成结构还原、逻辑抽取、程序生成与迭代修正的能力;
5.建设系统化评测体系:搭建 Visual2Code 能力评测与诊断体系,从视觉感知、结构理解、代码正确性、执行结果、视觉还原度、复杂推理等维度建立 Benchmark 与自动化评测链路,持续定位模型能力瓶颈并指导训练迭代;
6.探索 Agentic Vision 新范式:探索视觉模型与代码执行、工具调用、环境反馈等能力的结合,推动模型从一次性 Visual2Code 生成进一步走向“理解—生成—执行—观察—修正”的 Agentic Vision 闭环,提升模型自主解决复杂视觉任务的能力。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。