视频生成算法实习生 (数据/音频)
岗位信息
| 招聘单位 | 生数科技 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-08-31 23:34:15 |
职位描述
背景:
我们在训练文生视频基座模型。音频信号主要有两个用途:一是筛除口播、教程、访谈等画面价值低的素材,二是作为线索辅助画面打标。需要注意,音频内容不直接写入 caption,最终描述必须由画面证实。本岗位负责把音频信号抽取出来并转化为可用的过滤规则与打标线索。
职责:
- 搭建并维护音频抽取链路:语音识别与时间戳对齐、说话人分离、语音 / 音乐 / 环境音分类、音频事件检测
- 基于音频信号建立素材分类与过滤规则,识别口播、教程、访谈、MV、纯背景音乐、无声等类型,并评估过滤规则的准确率与误伤率
- 将转写文本整理为结构化线索供打标模型使用,明确界定哪些信息可作为提示、哪些不可进入最终 caption
- 分析音画一致性,识别配音、后期配乐、素材拼接等音频与画面无关的情况
- 维护评测集,持续评估 ASR 与音频分类在真实素材上的表现
任职要求
要求:
- 熟练 Python,能独立编写脚本处理大批量图像与视频帧
- 用过 PaddleOCR / EasyOCR 或同类 OCR 工具,理解检测与识别两个阶段
- 会用 ffmpeg 做抽帧、裁剪等基本视频处理
- 能看懂并使用 IoU、字符准确率、编辑距离等评估指标
- 细致,能把模糊的分类边界定义清楚并稳定执行(例如半透明台标与场景内广告牌如何区分)
加分:
- 做过文本检测或识别相关项目(DBNet、CRNN、TrOCR 等)
- 熟悉视频字幕结构与格式(时间轴、SRT / ASS),做过字幕提取或擦除
- 了解图像修复(inpainting),能实现水印去除
- 处理过多语种或艺术字、变形字等困难场景
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。