多模态大模型算法工程师(OCR/文字理解方向)
岗位信息
| 招聘单位 | 面壁智能 |
|---|---|
| 工作地点 | 北京、上海、成都、深圳 |
| 官方更新时间 | 2026-09-18 22:27:13 |
职位描述
1、OCR能力专项攻坚:负责多模态大模型OCR相关能力的建设与优化,包括但不限于复杂场景文字识别、文档解析、表格理解、版面分析、多语种OCR等方向的模型训练与效果提升。
2、数据体系建设:构建OCR/文档场景的大规模训练数据Pipeline,涵盖预训练数据清洗、SFT数据标注、评测集构建等环节,确保数据的质量、多样性和规模。
3、评测与闭环优化:建立OCR/文档场景的多维度评测体系,通过Badcase分析驱动模型迭代,形成“数据→训练→评测→优化”的正向循环。
4、前沿技术跟踪:持续追踪OCR/文档智能领域的前沿工作(如多模态文档理解、视觉富文本识别等),将新技术快速落地到模型迭代中。
5、协作与推进:与多模态理解、预训练、后训练等方向的同事紧密协作,推动模型整体能力的提升。
任职要求
1、2年以上多模态大模型(VLM)或多模态OCR/文档理解相关研发经验
2、熟悉Transformer架构及主流多模态模型(如Qwen-VL、InternVL、LLaVA等),有实际的SFT/RL训练经验
3、熟悉OCR/文档理解领域的关键技术(如版面分析、表格识别、Text-rich VQA等),了解该领域的技术演进路线
4、具备大规模多模态数据处理经验,熟悉数据清洗、标注、质量评估等数据工程建设方法
5、具备良好的沟通协作能力,能与算法、工程、数据团队高效配合
加分项
1、有多模态OCR相关论文发表(如CVPR、ICCV、ACL、NeurIPS等顶会)
2、有OCRBench、DocVQA、TextVQA等评测榜单的上榜经验或专项优化经验
3、有大规模多模态OCR数据集的构建经验
熟悉文档智能相关的模型架构(如Donut、LayoutLM、UDOP、GOT等)
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。