招聘公告 · 职位检索 · 央国企/事业单位/名企

AI infra工程师(J12733)

单位:芯动科技类型:社招地点:成都市更新:2026-09-24

岗位信息

招聘单位芯动科技
工作地点成都市
官方更新时间2026-07-09T15:47:51

职位描述

1.前沿框架调研

前沿技术探索,跟踪大模型领域最新模型和框架(sglang /vLLm)研究

2.大模型算法设计与优化

- 负责 Transformer 及其变体(如MoE)的算法研发与性能调优。

- 研究并实现高效注意力机制(如FlashAttention)以降低显存占用和计算延迟。

- 针对Inno GPU 架构特性优化模型计算流程,提升吞吐量与能效比。

2.模型压缩与量化技术开发

- 开发4-bit/8-bit 量化算子(如 GPTQ、AWQ),平衡精度与推理速度。

3.GPU 加速与并行计算

- 基于OpenCL/Hip编程,实现模型算子级优化(如矩阵乘法)。

4.开发分布式框架,支持多 GPU 或多节点

- 针对带宽瓶颈设计数据传输优化策略,减少通信延迟。

- 性能评估与工程落地

- 与其他团队协作,完成分布式部署

5.撰写技术文档,输出专利或论文。

任职要求

具备良好的沟通能力,能与硬件、软件团队高效协作。

1.学历与背景

硕士及以上学历,计算机科学、电子工程、数学等相关专业。有大模型(LLM)研发经验 ,熟悉典型模型架构(如GPT、BERT、LLaMA)

2.技术能力

- 熟悉深度学习框架(PyTorch/TensorFlow,sglang /vLLm/ Transformer),掌握其底层原理与算子优化方法。

- 熟悉CUDA 编程 ,具备 GPU 并行计算、内存管理及性能调优经验。

- 熟悉模型量化技术有实际项目落地案例。

- 掌握分布式技术(如DP/TP/PP/EP)。

3.编程与工程能力

- 熟练使用 C/C++、Python ,具备高性能代码开发能力。熟悉版本控制工具(Git)

- 有开源社区贡献经验者优先。

- 熟悉 NVIDIA GPU 架构(如 Ampere、Hopper),了解 TensorRT、cuDNN、NCCL 等库者优先。

- 熟悉模型服务化框架(如 Triton、TFServing、ONNX Runtime)

- 有大规模模型部署经验者优先。

- 熟悉 芯片架构设计(如 GPU、ASIC)者优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。