招聘公告 · 职位检索 · 央国企/事业单位/名企

AI工程师(AI平台-配音)

单位:麦芽传媒类别:研发类型:社招地点:重庆、北京更新:2026-09-24

岗位信息

招聘单位麦芽传媒
工作地点重庆、北京
官方更新时间2026-01-04 15:31:35

职位描述

1. 全链路配音Agent编排:

- 基于 LangGraph / AutoGen 设计全自动配音工作流:视频提取人声伴奏分离ASR识别,说话人区分(Diarization)LLM剧本翻译 TTS合成音画对齐合成。

- 设计多Agent协作机制:例如“翻译Agent”负责信达雅,“对轨Agent”负责检查翻译后的语音时长是否与原视频嘴型时间窗口匹配。

2. 自适应翻译与时长控制(Duration-Aware Translation):

- 这是本岗位的核心难点。你需要通过Prompt Engineering或Fine-tuning,让LLM在翻译时感知时长约束(例如:原句3秒,翻译出的英文也必须能在3秒内读完)。

- 设计Reflexion(反思)机制:当合成语音时长溢出时,Agent能自动触发“重写策略”,精简台词以适配时间轴。

3. 声音克隆与情感控制:

- 集成并优化主流TTS/SVC模型(如CosyVoice, ChatTTS, XTTS, OpenVoice),实现“几秒音频复刻角色声线”。

- 通过Agent提取原视频的情感特征(Prompt: "An angry man shouting"),并将其注入到TTS生成参数中,拒绝“棒读”。

4. 音频工程自动化:

- 调用FFmpeg/Sox或Python音频库,实现精细化的音频处理(淡入淡出、自动闪避Auto-ducking、背景音与新配音的融合)。

任职要求

1. 核心开发能力:

- 计算机、信号处理或相关专业本科及以上学历,5年以上开发经验。

- Python 功底深厚,熟练使用 LangChain/LlamaIndex 框架,且有FFmpeg深度使用经验(必选项)。

2. 音频/多模态AI经验(关键):

- 懂TTS/ASR: 熟悉 Whisper(语音识别)、Pyannote(声纹识别/说话人区分)以及主流TTS模型的API调用与参数调优。

- 懂音频处理: 了解采样率、时频图、Mel频谱等基础概念,熟悉 Librosa, Pydub 等库。

- 懂RVC/SVC: 了解变声/歌声转换技术(RVC/So-VITS-SVC),理解如何通过SVC保留原声的情感语调。

3. Agent工程化思维:

- 具备解决非结构化问题的能力。例如:如何处理多人同时说话(Overlapping speech)的场景,如何处理原视频中的无声片段。

- 善于利用LLM进行结构化数据提取(比如输出带有时间戳的SRT/JSON格式)。

4. 加分项

- 唇形同步(Lip-Sync)经验: 熟悉 Wav2Lip, SadTalker, MuseTalk, VideoRetalking 等技术,能通过Agent自动修改视频嘴型以匹配新的配音语言。

- 背景音分离经验: 熟悉 UVR5 (Ultimate Vocal Remover) 或 Spleeter,能完美分离人声与BGM。

- 小语种优化经验: 了解泰语、阿语等小语种的TTS特性及发音韵律调整。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。