llm服务部署工程师
岗位信息
| 招聘单位 | 智元机器人 |
|---|---|
| 工作地点 | 北京、上海 |
| 官方更新时间 | 2026-04-20 22:25:00 |
职位描述
岗位职责
1. 负责LLM从预训练模型到边缘推理服务的完整集成与落地,搭建LLM服务化CI/CD流水线,实现模型量化、编译优化、前后处理标准化和推理服务一键部署。
2. 设计开发边缘LLM推理服务流水线,支持主流推理引擎(SGLang、vLLM、Nano-LLM)的自动集成、性能测试、服务封包、版本发布,保障模型在边缘设备上的稳定运行。
3. 针对边缘设备资源受限场景,设计并实现模型量化压缩方案(AWQ、GPTQ、GGUF/INT4/INT8),优化模型推理延迟与内存占用,确保在Jetson Nano/Xavier等边缘设备上的高效运行。
4. 开发模型微调(Fine-tune)标准化流程,支持基于LoRA/QLoRA的参数高效微调,实现数据预处理、训练、评估、部署的全流程自动化。
5. 开发业务方常用的压测、回测、精度排查、服务调用等功能工具,提供性能监控、日志追踪、错误诊断等运维能力,保障LLM服务在边缘环境的高可用性。
任职要求
1. 计算机相关专业本科及以上,3年以上AI模型部署或边缘计算开发经验
2. 精通Python/C++,熟悉PyTorch、Transformers框架,了解HuggingFace生态
3. 熟练掌握SGLang、vLLM、Nano-LLM等LLM推理引擎的原理与使用,有实际部署经验
4. 深入理解模型量化技术(AWQ、GPTQ、GGUF等),有端侧模型压缩实战经验
5. 熟悉LoRA、QLoRA等参数高效微调技术,有实际fine-tune项目经验
加分项
1. 熟悉Jetson系列设备(Nano/Xavier/Nova)的开发与优化
2. 有DeepSeek、Qwen、Llama系列模型的部署调优经验
3. 熟悉SGLang的RadixAttention机制和结构化生成(structured generation)
4. 有Agent系统开发经验,了解多步骤推理流程
5. 有模型服务化(Model-as-a-Service)平台建设经验
6. 熟悉Medusa、EAGLE等加速推理框架
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。