招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型推理优化工程师

单位:优刻得类型:社招地点:上海市更新:2026-09-24

岗位信息

招聘单位优刻得
工作地点上海市
官方更新时间2026-05-21T10:18:07

职位描述

大模型推理优化工程师

职位描述

负责LLM/VLM大模型的部署与推理性能优化,系统性降低硬件延迟瓶颈,保障高并发下线上服务稳定性(TTFT与TPOT满足SLA要求)。

探索前沿推理加速技术,推动在新型GPU/NPU等硬件上的落地。

任职要求

职位要求

1. 精通Python,熟悉C++,具备高性能代码开发与算法实现能力。

2. 至少具备以下2个领域中的实践经验:

a. Transformers与Diffusers库,深入理解Attention变体(GQA、MLA、Linear Attn、Sparse Attn)及其优化技术(FlashAttention、PagedAttention);

b. GPU编程(CUDA/cutlass/Triton/TileLang开发)且掌握性能分析工具(Nsight、PyTorch Profiler等);

c. 模型压缩(量化、稀疏化、知识蒸馏);

d. GPU集群通信架构(卡间通信NVLink/PCIe,机间通信RDMA/RoCE),理解NCCL、HCCL等通信库的工作机制;

3. 符合以下条件者优先:

a. 有超大规模模型(1T参数以上)的分布式部署经验;

b. 有推理系统经验,如为vLLM、SGLang、TensorRT-LLM贡献过核心PR;

c. 有投机采样(Speculative Decoding)的落地与优化经验(如EAGLE、DFlash等);

d. 有相关开源项目、专利或论文发表;

e. 有国产芯片(如昇腾、海光等)的在线服务加速经验。

4. 良好的团队协作能力与工程落地能力,对技术有持续热情。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。