【大模型北斗实习】语音基座大模型前沿探索
岗位信息
| 招聘单位 | 美团 |
|---|---|
| 工作地点 | 北京市、上海市 |
| 官方更新时间 | 1747963942000 |
职位描述
语音基座大模型是下一代语音算法的基础,也是多模态大模型研究的重要组成部分。本课题研究方向包括不限于:
1)预训练方法研究:设计预训练任务,使训练可大规模扩展,且能够学习到丰富的知识,使得模型同时具备强大的理解和生成能力,进一步实现能力的涌现。
2)tokenizer 优化:探索同时适用于理解和生成任务、兼顾学习效率和效果的tokenizer。
3)泛音频理解:对语音理解之外,探索更广泛的音频(如音乐、环境声)理解能力,以及基于 reasoning 的理解能力。
4) token2wav:与基座大模型配合,实现高效、高质量的语音/音频生成。
5) post-training:探索基于 SFT 和 RL 的后训练策略,激活基座模型的理解和生成能力,实现通用的音频能力,并具备强表现力、多风格、多语种、多音色的能力。
任职要求
1)对语音、NLP、CV等相关领域一个或多个方向有深入的研究经历,且有相关实际项目经验。
2)熟练使用深度学习框架(比如PyTorch),熟悉 Megatron、DeepSpeed 等开源训练框架。
加分项:
1)在知名开源项目中有核心贡献者优先。
2)对大模型有深入研究且有实际训练经验者优先。
3)发表过高水平论文。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。