招聘公告 · 职位检索 · 央国企/事业单位/名企

llm服务部署工程师

单位:智元机器人类别:互联网 / 电子 / 网游类型:社招地点:北京、上海更新:2026-09-24

岗位信息

招聘单位智元机器人
工作地点北京、上海
官方更新时间2026-04-20 22:25:00

职位描述

岗位职责

1. 负责LLM从预训练模型到边缘推理服务的完整集成与落地,搭建LLM服务化CI/CD流水线,实现模型量化、编译优化、前后处理标准化和推理服务一键部署。

2. 设计开发边缘LLM推理服务流水线,支持主流推理引擎(SGLang、vLLM、Nano-LLM)的自动集成、性能测试、服务封包、版本发布,保障模型在边缘设备上的稳定运行。

3. 针对边缘设备资源受限场景,设计并实现模型量化压缩方案(AWQ、GPTQ、GGUF/INT4/INT8),优化模型推理延迟与内存占用,确保在Jetson Nano/Xavier等边缘设备上的高效运行。

4. 开发模型微调(Fine-tune)标准化流程,支持基于LoRA/QLoRA的参数高效微调,实现数据预处理、训练、评估、部署的全流程自动化。

5. 开发业务方常用的压测、回测、精度排查、服务调用等功能工具,提供性能监控、日志追踪、错误诊断等运维能力,保障LLM服务在边缘环境的高可用性。

任职要求

1. 计算机相关专业本科及以上,3年以上AI模型部署或边缘计算开发经验

2. 精通Python/C++,熟悉PyTorch、Transformers框架,了解HuggingFace生态

3. 熟练掌握SGLang、vLLM、Nano-LLM等LLM推理引擎的原理与使用,有实际部署经验

4. 深入理解模型量化技术(AWQ、GPTQ、GGUF等),有端侧模型压缩实战经验

5. 熟悉LoRA、QLoRA等参数高效微调技术,有实际fine-tune项目经验

加分项

1. 熟悉Jetson系列设备(Nano/Xavier/Nova)的开发与优化

2. 有DeepSeek、Qwen、Llama系列模型的部署调优经验

3. 熟悉SGLang的RadixAttention机制和结构化生成(structured generation)

4. 有Agent系统开发经验,了解多步骤推理流程

5. 有模型服务化(Model-as-a-Service)平台建设经验

6. 熟悉Medusa、EAGLE等加速推理框架

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。