招聘公告 · 职位检索 · 央国企/事业单位/名企

视频生成算法实习生 (数据/OCR)

单位:生数科技类别:算法类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位生数科技
工作地点北京
官方更新时间2026-08-31 23:31:09

职位描述

背景:

我们在训练文生视频基座模型。视频画面中的文字既是需要剔除的噪声(字幕、水印、台标、弹幕),也可能是需要描述的内容(招牌、路牌、屏幕显示等场景内自然文字)。本岗位负责把这两类文字区分开,并支撑数据清洗与打标。

职责:

- 搭建并维护画面文字抽取链路:文字检测、识别、区域定位、语种判别

- 建立文字类型分类体系,区分硬字幕、软字幕、水印、台标、弹幕、场景内自然文字,并标注其位置、时间区间与视觉显著度

- 设计数据清洗规则:判定素材应剔除、裁剪还是保留,并评估规则在大规模素材上的召回与误伤

- 为视觉上显著的场景文字制定进入 caption 的描述规范,并产出标注

- 维护 badcase 集,持续评估 OCR 与文字分类在真实素材上的准确率,定位系统性错误

任职要求

要求:

- 熟练 Python,能独立编写脚本处理大批量图像与视频帧

- 用过 PaddleOCR / EasyOCR 或同类 OCR 工具,理解检测与识别两个阶段

- 会用 ffmpeg 做抽帧、裁剪等基本视频处理

- 能看懂并使用 IoU、字符准确率、编辑距离等评估指标

- 细致,能把模糊的分类边界定义清楚并稳定执行(例如半透明台标与场景内广告牌如何区分)

加分:

- 做过文本检测或识别相关项目(DBNet、CRNN、TrOCR 等)

- 熟悉视频字幕结构与格式(时间轴、SRT / ASS),做过字幕提取或擦除

- 了解图像修复(inpainting),能实现水印去除

- 处理过多语种或艺术字、变形字等困难场景

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。