AI模型工程化与推理优化工程师
岗位信息
| 招聘单位 | 镁伽科技 |
|---|---|
| 工作地点 | 苏州市、上海市、北京市 |
| 官方更新时间 | 2026-05-13T18:14:47 |
职位描述
1. 负责大模型(基座 / 微调 / 多模态)的推理部署与性能优化,支撑镁伽实验室及工厂场景下高并发、低延迟的 API 服务需求。
2. 基于 TensorRT-LLM、vLLM、Triton 等框架,实施 INT4/FP8 量化、KV Cache 优化、算子定制化开发,提升推理吞吐、降低显存占用。
3. 构建大模型服务化平台:API 网关、负载均衡、监控告警、A/B 测试,保障 7×24 小时稳定运行,满足无人值守场景的可靠性要求。
4. 优化模型在边缘设备(工业 PC、嵌入式 GPU)的部署,适配镁嘉实验室及工厂的本地化、低带宽环境,保障数据安全与实时性。
5. 负责大模型与镁伽现有系统(Labillion、MES、ERP、LIMS)的集成,打通数据与业务流程,实现 AI 能力无缝嵌入自动化产线。
6. 负责对接生态合作伙伴(如 NVIDIA 等),引入先进硬件与推理加速方案,保持技术领先性。
任职要求
1. 硕士及以上学历,计算机 / 软件工程 / AI 相关专业,3 年以上大模型推理优化与工程化经验。
2. 精通 PyTorch、ONNX、TensorRT,熟悉 vLLM、Triton、DeepSpeed-Inference 等推理框架。
3. 掌握模型量化、剪枝、蒸馏、算子优化技术,有千亿级模型部署实战经验。
4. 熟练使用 Python/C++,有高并发 API 服务(FastAPI/Go)开发、容器化(Docker/K8s)部署经验。
5. 有工业软件、实验室系统或智能制造平台集成经验,熟悉镁伽 Labillion/Librax 或类似自动化平台者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。