大模型推理框架工程师实习生
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海、深圳、杭州 |
| 经验要求 | 1 |
| 官方更新时间 | 2026-09-14 17:23:09 |
职位描述
1、参与大模型推理引擎核心模块的设计、开发与测试,提升系统吞吐、降低推理延迟与成本;
2、探索并验证先进推理加速方案,如量化、KV Cache、PagedAttention、连续批处理、投机解码、分布式推理、算子优化等;
3、参与推理平台与云平台建设:基于 Kubernetes/K8s、Docker、Helm 等,实现模型部署、弹性扩缩容、灰度发布、多租户资源隔离、监控告警与 CI/CD;
4、参与 GPU/NPU 资源调度与集群利用率优化,提升推理服务稳定性与云平台资源管理效率;
5、跟踪开源社区(如 vLLM、TensorRT-LLM、SGLang、LMDeploy 等)前沿动态,完成技术调研、复现与验证;
6、与算法、业务和平台团队协作,优化端到端推理体验。
任职要求
1、本科及以上在读,计算机、AI、软件工程、电子信息、数学等相关专业;
2、熟悉 Python,了解大模型 Transformer 基本工作原理;
3、具备良好的工程习惯,熟悉 Linux、Git,学习能力强,能阅读英文技术资料;
4、了解或对 Kubernetes/K8s、Docker、云平台、云原生技术有浓厚兴趣;
5、乐于沟通协作,对 AI Infra、大模型推理方向有热情;
6、每周至少 4 天,连续实习 3 个月以上,6 个月优先,尽快到岗。能保证稳定实习时间,有较强的自我驱动能力。
加分项(非必需)
有 vLLM、SGLang、TensorRT-LLM、LMDeploy 等推理框架使用或二次开发经验;
有 CUDA/Triton 算子编写经历;
有 Kubernetes、Docker、云平台、Ray、Volcano、Kueue、Prometheus/Grafana 等云原生或 MLOps/LLMOps 实践经验;
有 LLM 相关论文、开源项目、竞赛经历或高质量技术博客;
有模型部署、压测、性能分析、监控告警相关经验。
我们提供
资深大佬 1v1 带教,直接参与核心模块,拒绝边缘打杂;
真实业务场景 + 充足 GPU/NPU 资源,以及 K8s/云平台真实生产环境;
一群热爱技术的同龄人,一起把技术做深做透;
接触大模型推理与云原生 AI 基础设施前沿,支持技术分享、开源贡献与论文发表;
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。