招聘公告 · 职位检索 · 央国企/事业单位/名企

端侧大模型推理工程师

单位:面壁智能类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位面壁智能
工作地点北京
官方更新时间2026-08-20 13:22:56

职位描述

负责在异构端侧上落地大模型与多模态推理系统,深入底层系统、GPU/NPU/CPU 异构计算,优化模型推理性能,解决实际使用过程中的长尾问题,确保模型推理在端侧高效、稳定运行。

工作内容包括:

1、端侧语言模型 / 多模态模型推理部署;

2、异构硬件性能调优与内存管理;

3、推理框架、工具链、跨平台构建系统开发与优化;

4、模型量化、KV Cache 管理与端侧推理优化;

5、跟进前沿模型架构(如 Transformer 及其衍生变体、投机解码加速技术 EAGLE 系列等)的迭代演进。

任职要求

1、了解主流模型架构,包括 Transformer 系列、LLaMA、Qwen等,能分析其计算与内存特点;

2、熟悉至少一种端侧推理框架(llama.cpp / TensorRT / QNN / ONNX Runtime);

3、了解投机采样(Speculative Decoding / Sampling)等推理加速思路,能够分析其对端侧延迟、内存和工程复杂度的影响;

4、精通 C/C++/python;

5、熟悉 mmap / CMA / GPU OOM / 内存调优,能分析内存带宽与计算瓶颈并进行仿存与计算逻辑优化。

加分项:

1、有CUDA / OpenCL / 自定义推理算子实现经验;

2、有 Android NDK / aarch64 交叉编译经验;

3、有MoE模型开发经验;

4、Orin平台开发经验;

5、有模型压缩、量化、蒸馏技术经验优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。