大模型部署算法工程师
岗位信息
| 招聘单位 | 汇川技术 |
|---|---|
| 工作地点 | 南京市 |
| 官方更新时间 | 2025-07-22T10:08:31 |
职位描述
岗位职责
1.负责大模型在边缘端(边缘芯片与消费显卡)与云端(企业显卡集群)的端到端部署,涵盖蒸馏、量化、剪枝、Flash-Attention、Cache 等多种压缩与加速技术。
2.设计并实现分布式推理架构,支持大模型云服务的弹性扩缩与动态负载均衡。
3.主导边侧芯片选型与评估:结合算子支持度、功耗、成本、带宽等指标,完成 Benchmark 测试并输出选型报告;深度参与硬件联调,解决显存带宽、Cache 命中率、PCIe 瓶颈等问题。
4.构建端到端性能分析体系:基于Nsight、VTune、Roofline Model 等工具,对推理链路做全栈 profiling;定位并优化计算、通信、内存墙瓶颈。
5.跟踪前沿技术(如 KV-Cache 压缩、MoE 稀疏化、Speculative Decoding等),通过 PoC 到产品化路径推动落地,提升团队技术竞争力。
任职要求
任职要求
1. 计算机/电子/通信等相关专业本科及以上学历,硕士/博士优先。
2. 深入理解 Transformer 系列大模型结构及推理流程;熟练掌握至少一种主流推理框架(vLLM、TensorRT-LLM、SGLang、DeepSpeed-Inference、TVM、XLA 等)。
加分项
1. 熟悉大模型量化技术(GPTQ、AWQ、SmoothQuant、ZeroQuant 等)及其实现细节;有 INT4/INT8/FP8 精度落地经验。
2. 熟悉 AI 加速芯片(GPU/NPU/TPU)架构及并行计算模型;具备 CUDA/OpenCL/ROCm等任一底层编程经验。
3. 具备分布式系统或高性能算子开发经验,熟悉 NCCL、RDMA、GDR、NVLink 等;有集群部署与性能调优经验者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。