大模型音频理解算法工程师-抖音音乐
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-06-11 11:48:22 |
职位描述
1、参与公司音乐业务音频智能监控与评估体系建设,面向抖音、汽水音乐等产品,研发基于大模型的音频理解与音质分析算法,构建规模化、自动化的音质大盘监控能力;研究音质指标建模、异常检测、质量趋势分析与问题聚类算法,实现音质问题的自动发现、定位和归因,为业务音质优化提供数据与算法支撑;
2、研发面向音乐内容的音频理解大模型,利用Audio Foundation Model、多模态大模型(MLLM)及大语言模型(LLM)等技术,实现音质问题识别、音频缺陷检测、质量评分与自然语言描述,包括但不限于噪声、失真、爆音、削波、带宽受损、编解码损伤、响度异常等问题;
3、探索大模型在Audio Quality Assessment(AQA)领域的应用,研究基于音频大模型的MOS预测、感知质量建模、Audio Reasoning、Audio Captioning及音质问题解释能力,推动音质评估从“单一分数”向“问题理解与可解释分析”演进;
4、研究音频大模型的训练与后训练技术,包括音频表征学习、Audio-Text Alignment、SFT、Preference Learning、RL等,持续提升模型在音乐音质理解、复杂问题识别及专业音频分析场景中的能力;
5、跟踪Audio Foundation Model、Audio LLM、多模态大模型及音频理解领域的国际前沿研究成果,持续推动算法创新与业务落地。
任职要求
1、本科及以上学历,计算机科学、电子工程、通信工程、声学、信号处理、人工智能等相关专业;
2、熟悉深度学习及大模型基础理论,掌握Transformer、Attention等核心技术,熟练使用PyTorch、TensorFlow等至少一种深度学习框架;
3、具备良好的音频与数字信号处理基础,理解时频分析、频谱、响度、动态范围、音频编解码及常见音质问题;
4、熟悉Python,并掌握C/C++、MATLAB等至少一种编程语言,具备良好的算法实现与工程能力;
5、对音频大模型、多模态大模型、音乐理解或Audio AI有浓厚兴趣,具有良好的学习能力、问题分析能力和团队合作精神。
加分项:
1、有Audio Foundation Model、Audio LLM、多模态大模型或音频理解相关科研、竞赛或项目经验;
2、有Audio Quality Assessment(AQA)、MOS Prediction、PESQ、POLQA、ViSQOL、DNSMOS、NISQA等音质评估相关经验;
3、熟悉Audio-Text Alignment、Audio Captioning、Audio Reasoning、SFT、RLHF、Preference Learning等大模型训练与后训练技术,并有实际项目经验;
4、有海量音频数据分析、音质监控、异常检测、数据挖掘或大规模自动化评测系统建设经验;
5、熟悉音频编解码(Codec)、Neural Codec、音频增强、音频生成等技术,能够理解不同音频处理链路对最终音质的影响;
6、在ICASSP、Interspeech、NeurIPS、ICLR、ACL、EMNLP、IEEE TASLP等会议或期刊发表论文,或在音频、多模态、大模型相关竞赛中取得优异成绩,或有开源项目、GitHub、个人作品或技术博客等展示材料。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。