语音大模型后端工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 上海 |
| 官方更新时间 | 2026-07-01 19:50:52 |
职位描述
•ASR服务开发:设计并实现高吞吐量的语音识别后端服务,支持实时流式转写、时间戳对齐等功能,优化首字延迟与尾字延迟
•TTS服务开发:构建低延迟语音合成服务,实现流式音色克隆、情感控制、多语言混合合成,优化音频流分片与传输策略
•Omni端到端服务:开发端到端语音交互系统,支持语音到语音的直接推理,实现全双工对话能力
•流式处理架构:设计WebSocket/HTTP2流式传输协议,实现Chunk级数据流转,优化端到端延迟至200ms以内
•高并发系统:构建支持高并发的服务集群,实现负载均衡、弹性扩缩容、故障自动恢复
•模型部署优化:负责大模型的推理加速(TensorRT/vLLM/TensorRT-LLM),实现GPU资源调度与多卡推理优化
•业务中台建设:搭建语音AI业务中台,抽象通用能力,支撑多业务线快速接入
任职要求
基础要求
•本科及以上学历,计算机、通信、电子工程等相关专业,5年以上后端开发经验
•精通Python/Go/C++至少一门语言,具备扎实的多线程/多进程编程能力
•深入理解流式处理架构,熟悉WebSocket、HTTP/2、GRPC等实时通信协议
•熟悉语音AI领域,了解ASR、TTS、Omni模型原理
•掌握大模型推理优化技术,有vLLM、TensorRT-LLM、Triton Inference Server等部署经验
•熟悉Kubernetes、Docker等容器化部署,具备云原生架构设计能力
核心技术栈(必备)
•深度学习框架:PyTorch、ONNX Runtime、TensorRT
•流式处理:WebSocket、Server-Sent Events、HTTP/2 Server Push、GRPC Streaming
•音频处理:FFmpeg、WebRTC、Opus编码、音频分片与缓冲策略
•服务架构:FastAPI/Go-gin、gRPC、Redis、Kafka/RabbitMQ、Nginx
•运维监控:Prometheus、Grafana、ELK、链路追踪(Jaeger/Zipkin)
加分项
•有大规模语音AI服务落地经验
•熟悉端侧推理优化,有移动端/边缘设备语音模型部署经验
•开源语音项目贡献者(如Whisper、Kaldi、ESPnet等)
•有全双工语音对话系统开发经验
•熟悉大模型微调与量化技术(LoRA、QLoRA、AWQ、GGUF等)
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。