招聘公告 · 职位检索 · 央国企/事业单位/名企

多模态数据算法工程师 (音频)

单位:生数科技类别:互联网 / 电子 / 网游类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位生数科技
工作地点北京
官方更新时间2026-06-18 18:15:13

职位描述

1、音频预处理与解码:负责原始音频的元数据探测、抽轨、重采样、声道处理、音视频分离对齐。优化音频解码与加载,保证大规模任务的吞吐与稳定性;

2、源分离与语音切分:设计并落地人声 / 音乐 / 环境音分离、VAD / 说话人分离、Active Speaker Detection(ASD,判断画面中谁正在说话)、切点截断检测(避免腰斩台词)。建立切分与对齐评估,持续压误切、漏切、截断语音;

3、音频理解与结构化标注:接入 VLM 做音视频 caption、语义打标;接入语种识别、音质评估、音画同步等音频算子。保证标注 schema、token 用量、失败重试可统计、可回放。

任职要求

1、音频信号处理 / 语音 / 机器学习等相关专业;具有语音、音视频处理或大规模数据生产经验;

2、精通 Python;熟悉 PyTorch 推理落地(加载、batch、混合精度、OOM 降级);

3、熟悉音频基本处理:FFmpeg / ffprobe、抽轨、重采样、声道布局、音画时间对齐;有过长音频或直播流踩坑经验更佳;

4、做过至少一类音频模型生产化:源分离 / VAD / 说话人分离 / Active Speaker Detection / 语种识别 / 音质评估 / 音画同步 / VLM 打标中的若干项;

5、熟悉 Active Speaker Detection(音画联合判断当前说话人),有相关模型落地或数据生产经验;

6、加分项:说话人分离 / VAD / ASD / 切点安全的论文或生产经验,有人工标注对齐、failure mode 分析;VLM 音视频打标:prompt 设计、结构化输出、限流与 token 统计;音画同步、参考音频数据构建、多说话人或重叠语音处理。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。