招聘公告 · 职位检索 · 央国企/事业单位/名企

音频大模型算法专家 - 音视频技术

单位:字节跳动类别:算法类型:社招地点:深圳更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点深圳
官方更新时间2026-05-14 14:16:17

职位描述

团队介绍:视频与边缘部门承载了字节跳动的媒体内容分发基建及技术中台,支持了字节跳动全系产品,如抖音、今日头条、番茄小说、西瓜视频等APP的点播、直播、实时通信、图片等多媒体业务发展,同时将业务发展过程中沉淀下来的技术能力和工具,通过火山引擎对外输出,面向各行各业用户提供视频云产品和服务,愿景是为内外部业务伙伴提供最低成本、最优画质、最低延时、最安全可靠的富媒体内容分发解决方案,助力业务伙伴降本提效实现持续增长。

1、负责流式通用音频大模型的架构设计,推动语音识别(ASR)、说话人日志(SD)、情感分析和音频问答等多任务统一建模,提升语音合成(TTS)、音频生成、音色与韵律等副语言信息建模和音视频协同,打造行业领先的音频理解与生成能力;

2、负责流式音频生成模型与音频编码增强算法研发,探索高质量、低算力的实时音频生成方案,支撑语音合成与音频增强等业务场景落地;

3、设计并落地大规模多模态音频数据Pipeline,覆盖数据采集、跨模态对齐、质量评估与自动标注,构建高质量、可复用的训练数据飞轮;

4、研究音频编码器与大语言模型(LLM)的融合架构,优化跨模态注意力机制与统一特征表示,提升模型的指令遵循、情感表达与复杂音频理解能力;

5、跟踪音频大模型与多模态前沿技术,结合业务场景开展后训练(SFT/RLHF/DPO等)与领域适配,推动技术成果在产品中快速落地并形成业务价值。

任职要求

1、计算机科学、电子工程、信号处理、人工智能、声学等相关专业博士学位;

2、扎实的机器学习与深度学习理论基础,精通传统音频信号处理,并能与深度学习方法深度结合;

3、熟练掌握PyTorch/TensorFlow等深度学习框架,具备丰富的音频表征模型(自监督/半监督/有监督)设计、预训练与微调经验;

4、扎实的编程能力,熟练使用Python/C++,能够独立完成算法原型开发、实验验证与工程化落地;

5、优秀的问题分析与解决能力,对技术有追求,具备良好的沟通协作与跨团队技术推动力。

加分项:

1、有(万小时级以上)音频数据集构建、清洗与自动标注的实战经验;

2、熟悉模型压缩、量化、蒸馏与部署优化,有服务端或端侧(手机/IoT设备)音频模型落地经验;

3、在ICML、NeurIPS、ICASSP、Interspeech等顶会或核心期刊发表过音频大模型相关论文或参加相关比赛并获得TOP名次;

4、具备声学工程、心理声学背景,能够结合听觉感知原理优化模型设计;

5、有语音合成(TTS)、语音增强、音频编码等生成类模型的研发经验。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。