推理引擎工程师(J14427)
岗位信息
| 招聘单位 | 科大讯飞 |
|---|---|
| 工作地点 | 西安市 |
| 官方更新时间 | 2026-09-14T10:25:19 |
职位描述
1、负责模型推理引擎的设计与研发,将算法团队交付的 Python 模型代码与模型权重(深度学习模型、小尺寸大语言模型)工程化封装为高性能 C++ 推理库与服务,支撑端云多场景部署与产品集成;
2、负责模型转换、算子适配与推理性能优化(量化压缩、计算图优化、显存管理、批处理调度),保障工程实现与算法原型的精度对齐,达成时延、吞吐、成本目标,跟进问题闭环;
3、参与面向 30B 级 MoE 大语言模型与多模态模型的下一代推理引擎预研(专家并行、KV Cache 管理、投机解码、多模态编码器融合等),应用 AI 工具赋能研发,提升工程效能。
任职要求
1. 学历专业:计算机、软件工程、人工智能、电子信息、数学等相关专业本科及以上。
2. 专业基础:具备扎实的 C++ 功底(现代 C++、内存管理、多线程与并发),熟悉 Python 及 C++/Python 混合编程的基本方式(如 pybind11);理解深度学习基础原理(Transformer 结构、前向计算流程),了解模型推理的基本概念(算子、计算图、量化、KV Cache),具备性能与精度问题分析的基础能力。
3. 核心能力与经验:有 ONNX Runtime/TensorRT/llama.cpp/vLLM 等推理框架的使用或源码阅读经历,或 CUDA/SIMD 性能优化、模型量化部署相关的课程项目、竞赛、开源贡献、实习经历者优先;掌握 AI 编程工具在研发中的应用,能够借助 AI 辅助编写代码、分析性能数据、协助问题排查。
4. 综合素质:具备性能剖析与精度对齐问题的分析、定位和复盘能力(会使用 profiler 定位热点,能排查工程实现与原型间的数值差异),逻辑清晰;重视工程质量与交付稳定性,做事严谨细心,能够独立承担模块级设计、开发与交付。
5. 学习与创新能力:对推理加速、MoE 与多模态模型部署、端侧推理等方向感兴趣,主动追踪论文与开源社区前沿进展,愿意持续学习新技术;具备良好跨团队沟通能力,可配合算法研究员完成模型从原型到量产的落地。
6. 职业素养:对 AI 基础软件与极致性能优化有热情,认同推理引擎作为模型能力落地核心载体的价值,乐于尝试新的技术思路,参与推理引擎体系与工具链建设。
此岗位为科大讯飞集团统一招聘岗位,人员通过简历筛选、初试、复试、终审等环节后录用。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。