招聘公告 · 职位检索 · 央国企/事业单位/名企

语音大模型后端工程师

单位:智元机器人类别:互联网 / 电子 / 网游类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位智元机器人
工作地点上海
官方更新时间2026-07-01 19:50:52

职位描述

•ASR服务开发:设计并实现高吞吐量的语音识别后端服务,支持实时流式转写、时间戳对齐等功能,优化首字延迟与尾字延迟

•TTS服务开发:构建低延迟语音合成服务,实现流式音色克隆、情感控制、多语言混合合成,优化音频流分片与传输策略

•Omni端到端服务:开发端到端语音交互系统,支持语音到语音的直接推理,实现全双工对话能力

•流式处理架构:设计WebSocket/HTTP2流式传输协议,实现Chunk级数据流转,优化端到端延迟至200ms以内

•高并发系统:构建支持高并发的服务集群,实现负载均衡、弹性扩缩容、故障自动恢复

•模型部署优化:负责大模型的推理加速(TensorRT/vLLM/TensorRT-LLM),实现GPU资源调度与多卡推理优化

•业务中台建设:搭建语音AI业务中台,抽象通用能力,支撑多业务线快速接入

任职要求

基础要求

•本科及以上学历,计算机、通信、电子工程等相关专业,5年以上后端开发经验

•精通Python/Go/C++至少一门语言,具备扎实的多线程/多进程编程能力

•深入理解流式处理架构,熟悉WebSocket、HTTP/2、GRPC等实时通信协议

•熟悉语音AI领域,了解ASR、TTS、Omni模型原理

•掌握大模型推理优化技术,有vLLM、TensorRT-LLM、Triton Inference Server等部署经验

•熟悉Kubernetes、Docker等容器化部署,具备云原生架构设计能力

核心技术栈(必备)

•深度学习框架:PyTorch、ONNX Runtime、TensorRT

•流式处理:WebSocket、Server-Sent Events、HTTP/2 Server Push、GRPC Streaming

•音频处理:FFmpeg、WebRTC、Opus编码、音频分片与缓冲策略

•服务架构:FastAPI/Go-gin、gRPC、Redis、Kafka/RabbitMQ、Nginx

•运维监控:Prometheus、Grafana、ELK、链路追踪(Jaeger/Zipkin)

加分项

•有大规模语音AI服务落地经验

•熟悉端侧推理优化,有移动端/边缘设备语音模型部署经验

•开源语音项目贡献者(如Whisper、Kaldi、ESPnet等)

•有全双工语音对话系统开发经验

•熟悉大模型微调与量化技术(LoRA、QLoRA、AWQ、GGUF等)

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。