大模型推理优化工程师
岗位信息
| 招聘单位 | 优刻得 |
|---|---|
| 工作地点 | 上海市 |
| 官方更新时间 | 2026-05-21T10:18:07 |
职位描述
大模型推理优化工程师
职位描述
负责LLM/VLM大模型的部署与推理性能优化,系统性降低硬件延迟瓶颈,保障高并发下线上服务稳定性(TTFT与TPOT满足SLA要求)。
探索前沿推理加速技术,推动在新型GPU/NPU等硬件上的落地。
任职要求
职位要求
1. 精通Python,熟悉C++,具备高性能代码开发与算法实现能力。
2. 至少具备以下2个领域中的实践经验:
a. Transformers与Diffusers库,深入理解Attention变体(GQA、MLA、Linear Attn、Sparse Attn)及其优化技术(FlashAttention、PagedAttention);
b. GPU编程(CUDA/cutlass/Triton/TileLang开发)且掌握性能分析工具(Nsight、PyTorch Profiler等);
c. 模型压缩(量化、稀疏化、知识蒸馏);
d. GPU集群通信架构(卡间通信NVLink/PCIe,机间通信RDMA/RoCE),理解NCCL、HCCL等通信库的工作机制;
3. 符合以下条件者优先:
a. 有超大规模模型(1T参数以上)的分布式部署经验;
b. 有推理系统经验,如为vLLM、SGLang、TensorRT-LLM贡献过核心PR;
c. 有投机采样(Speculative Decoding)的落地与优化经验(如EAGLE、DFlash等);
d. 有相关开源项目、专利或论文发表;
e. 有国产芯片(如昇腾、海光等)的在线服务加速经验。
4. 良好的团队协作能力与工程落地能力,对技术有持续热情。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。