招聘公告 · 职位检索 · 央国企/事业单位/名企

多模态大模型算法工程师(OCR/文字理解方向)

单位:面壁智能类型:社招地点:北京、上海、成都、深圳更新:2026-09-24

岗位信息

招聘单位面壁智能
工作地点北京、上海、成都、深圳
官方更新时间2026-09-18 22:27:13

职位描述

1、OCR能力专项攻坚:负责多模态大模型OCR相关能力的建设与优化,包括但不限于复杂场景文字识别、文档解析、表格理解、版面分析、多语种OCR等方向的模型训练与效果提升。

2、数据体系建设:构建OCR/文档场景的大规模训练数据Pipeline,涵盖预训练数据清洗、SFT数据标注、评测集构建等环节,确保数据的质量、多样性和规模。

3、评测与闭环优化:建立OCR/文档场景的多维度评测体系,通过Badcase分析驱动模型迭代,形成“数据→训练→评测→优化”的正向循环。

4、前沿技术跟踪:持续追踪OCR/文档智能领域的前沿工作(如多模态文档理解、视觉富文本识别等),将新技术快速落地到模型迭代中。

5、协作与推进:与多模态理解、预训练、后训练等方向的同事紧密协作,推动模型整体能力的提升。

任职要求

1、2年以上多模态大模型(VLM)或多模态OCR/文档理解相关研发经验

2、熟悉Transformer架构及主流多模态模型(如Qwen-VL、InternVL、LLaVA等),有实际的SFT/RL训练经验

3、熟悉OCR/文档理解领域的关键技术(如版面分析、表格识别、Text-rich VQA等),了解该领域的技术演进路线

4、具备大规模多模态数据处理经验,熟悉数据清洗、标注、质量评估等数据工程建设方法

5、具备良好的沟通协作能力,能与算法、工程、数据团队高效配合

加分项

1、有多模态OCR相关论文发表(如CVPR、ICCV、ACL、NeurIPS等顶会)

2、有OCRBench、DocVQA、TextVQA等评测榜单的上榜经验或专项优化经验

3、有大规模多模态OCR数据集的构建经验

熟悉文档智能相关的模型架构(如Donut、LayoutLM、UDOP、GOT等)

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。