语音大模型算法工程师
岗位信息
| 招聘单位 | 宇树科技 |
|---|---|
| 工作地点 | 杭州市 |
| 官方更新时间 | 2026-06-16T14:14:38 |
职位描述
1. 负责端到端ASR(语音识别)、TTS(语音合成)大模型的训练、微调与迭代;
2. 通过LoRA/Adapter/指令微调等技术,适配机器人室内外复杂声学场景,提升识别准确率与合成自然度;
3. 针对机器人硬件资源限制,开展模型压缩(蒸馏/量化)、结构优化,平衡推理速度、效果与功耗,满足边缘端实时响应需求;
4. 构建语音交互数据闭环系统,制定数据收集、标注策略,通过持续学习迭代模型场景适配能力;
5. 跟进语音大模型领域前沿技术(实时流式识别、情感语音合成、低资源语言适配),开展预研并推动落地,提升机器人语音交互核心竞争力。
任职要求
1. 硕士及以上学历,计算机、人工智能、电子信息、自动化等相关专业,具备扎实的数学基础(概率论、线性代数、信息论);
2. 精通Transformer架构,熟悉ASR/TTS大模型训练、微调全流程,掌握分布式训练、模型并行、FlashAttention等优化技术;
3. 掌握语音信号处理核心原理,了解主流语音模型(Whisper、Parakeet、ChatTTS等),有复杂声学场景算法优化经验者优先;
4. 具备模型部署经验,熟悉ONNX/TensorRT等推理加速工具,有ROS/ROS2开发经验、机器人边缘端算法落地经验者优先;
5. 有ICASSP/Interspeech等顶会论文发表、开源项目核心贡献者优先。
加分项:
1. 有机器人语音交互产品量产落地经验,熟悉量产过程中的技术规范与问题解决方案。
2. 具备多模态融合(语音+视觉+文本)算法研发经验,或情感语音合成、方言/小语种语音模型优化经验。
3. 熟悉声纹识别、语音唤醒等技术,有端云协同语音交互系统设计经验。
4. 具备良好的技术视野,能快速跟进行业前沿动态并转化为落地方案。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。