语音合成大模型算法工程师
岗位信息
| 招聘单位 | 哔哩哔哩 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-09-24 19:26:24 |
职位描述
工作职责:
1.负责语音大模型(Speech LLM)及语音生成技术的研发与迭代,聚焦高保真语音合成(TTS)、零样本音色克隆、情感/风格可控语音生成等方向,持续挑战技术边界。
2.紧密跟踪语音合成领域最新进展(如基于 LLM 的端到端语音生成、扩散/流匹配语音模型等),推动研究成果向业务转化,并在顶级会议/期刊发表高水平论文。
3.将语音生成技术工程化落地于 B站视频出海、内容创作、虚拟主播等核心场景,解决音色相似度、情感表现力、多语言支持等实际业务痛点,打造行业领先的语音创作工具。
工作要求:
1.计算机科学、人工智能、信号处理等相关专业硕士及以上学历,具备扎实的机器学习、深度学习理论基础;
2.深入理解多模态与生成式模型原理,熟悉大模型底层技术(如 Transformer、Diffusion、Flow Matching、自回归建模等);在语音生成领域有前沿技术研究及论文发表经验,敢于挑战技术边界;
3.对主流语音合成架构有深入理解,熟悉 IndexTTS、CosyVoice等开源语音合成模型,具备模型训练、微调、推理优化及工程化部署的实战经验;
4.有 ACM/ICPC、Kaggle 等编程竞赛获奖经历,或 GitHub 开源项目具有较大影响力者优先;
5.InterSpeech、ICASSP、NeurIPS、ICML、ACL 等语音或 AI 顶会/顶刊发表过相关论文者优先;
6.熟练使用AI agent能力者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。