AI工程师(AI平台-配音)
岗位信息
| 招聘单位 | 麦芽传媒 |
|---|---|
| 工作地点 | 重庆、北京 |
| 官方更新时间 | 2026-01-04 15:31:35 |
职位描述
1. 全链路配音Agent编排:
- 基于 LangGraph / AutoGen 设计全自动配音工作流:视频提取人声伴奏分离ASR识别,说话人区分(Diarization)LLM剧本翻译 TTS合成音画对齐合成。
- 设计多Agent协作机制:例如“翻译Agent”负责信达雅,“对轨Agent”负责检查翻译后的语音时长是否与原视频嘴型时间窗口匹配。
2. 自适应翻译与时长控制(Duration-Aware Translation):
- 这是本岗位的核心难点。你需要通过Prompt Engineering或Fine-tuning,让LLM在翻译时感知时长约束(例如:原句3秒,翻译出的英文也必须能在3秒内读完)。
- 设计Reflexion(反思)机制:当合成语音时长溢出时,Agent能自动触发“重写策略”,精简台词以适配时间轴。
3. 声音克隆与情感控制:
- 集成并优化主流TTS/SVC模型(如CosyVoice, ChatTTS, XTTS, OpenVoice),实现“几秒音频复刻角色声线”。
- 通过Agent提取原视频的情感特征(Prompt: "An angry man shouting"),并将其注入到TTS生成参数中,拒绝“棒读”。
4. 音频工程自动化:
- 调用FFmpeg/Sox或Python音频库,实现精细化的音频处理(淡入淡出、自动闪避Auto-ducking、背景音与新配音的融合)。
任职要求
1. 核心开发能力:
- 计算机、信号处理或相关专业本科及以上学历,5年以上开发经验。
- Python 功底深厚,熟练使用 LangChain/LlamaIndex 框架,且有FFmpeg深度使用经验(必选项)。
2. 音频/多模态AI经验(关键):
- 懂TTS/ASR: 熟悉 Whisper(语音识别)、Pyannote(声纹识别/说话人区分)以及主流TTS模型的API调用与参数调优。
- 懂音频处理: 了解采样率、时频图、Mel频谱等基础概念,熟悉 Librosa, Pydub 等库。
- 懂RVC/SVC: 了解变声/歌声转换技术(RVC/So-VITS-SVC),理解如何通过SVC保留原声的情感语调。
3. Agent工程化思维:
- 具备解决非结构化问题的能力。例如:如何处理多人同时说话(Overlapping speech)的场景,如何处理原视频中的无声片段。
- 善于利用LLM进行结构化数据提取(比如输出带有时间戳的SRT/JSON格式)。
4. 加分项
- 唇形同步(Lip-Sync)经验: 熟悉 Wav2Lip, SadTalker, MuseTalk, VideoRetalking 等技术,能通过Agent自动修改视频嘴型以匹配新的配音语言。
- 背景音分离经验: 熟悉 UVR5 (Ultimate Vocal Remover) 或 Spleeter,能完美分离人声与BGM。
- 小语种优化经验: 了解泰语、阿语等小语种的TTS特性及发音韵律调整。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。