招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型部署算法工程师

单位:汇川技术类型:社招地点:南京市更新:2026-09-24

岗位信息

招聘单位汇川技术
工作地点南京市
官方更新时间2025-07-22T10:08:31

职位描述

岗位职责

1.负责大模型在边缘端(边缘芯片与消费显卡)与云端(企业显卡集群)的端到端部署,涵盖蒸馏、量化、剪枝、Flash-Attention、Cache 等多种压缩与加速技术。

2.设计并实现分布式推理架构,支持大模型云服务的弹性扩缩与动态负载均衡。

3.主导边侧芯片选型与评估:结合算子支持度、功耗、成本、带宽等指标,完成 Benchmark 测试并输出选型报告;深度参与硬件联调,解决显存带宽、Cache 命中率、PCIe 瓶颈等问题。

4.构建端到端性能分析体系:基于Nsight、VTune、Roofline Model 等工具,对推理链路做全栈 profiling;定位并优化计算、通信、内存墙瓶颈。

5.跟踪前沿技术(如 KV-Cache 压缩、MoE 稀疏化、Speculative Decoding等),通过 PoC 到产品化路径推动落地,提升团队技术竞争力。

任职要求

任职要求

1. 计算机/电子/通信等相关专业本科及以上学历,硕士/博士优先。

2. 深入理解 Transformer 系列大模型结构及推理流程;熟练掌握至少一种主流推理框架(vLLM、TensorRT-LLM、SGLang、DeepSpeed-Inference、TVM、XLA 等)。

加分项

1. 熟悉大模型量化技术(GPTQ、AWQ、SmoothQuant、ZeroQuant 等)及其实现细节;有 INT4/INT8/FP8 精度落地经验。

2. 熟悉 AI 加速芯片(GPU/NPU/TPU)架构及并行计算模型;具备 CUDA/OpenCL/ROCm等任一底层编程经验。

3. 具备分布式系统或高性能算子开发经验,熟悉 NCCL、RDMA、GDR、NVLink 等;有集群部署与性能调优经验者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。