招聘公告 · 职位检索 · 央国企/事业单位/名企

端侧多模态推理引擎高性能优化工程师-AML(上海/杭州/广州/深圳)

单位:字节跳动类别:机器学习类型:社招地点:上海更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点上海
官方更新时间2024-09-24 11:51:04

职位描述

1、负责开发和优化字节跳动公司级的端侧AI推理框架,通过CPU/GPU/DSP/NPU的并行计算优化、架构设计、稀疏优化、异构调度等多种高性能优化技术打造业界领先的高性能异构AI推理引擎;

2、负责将LLM、多模态、AIGC等大模型算法在端侧做AI推理技术优化,落地到抖音、剪映、火山引擎等产品,支撑字节跳动AI业务的发展;

3、负责AI模型和推理框架工具链开发及技术生态的建设。

任职要求

1、本科及以上学历,计算机/电子/信息/通信/自动化/软件等相关专业,有AI工程优化经验优先;

2、精通C/C++,精通算法与数据结构,熟悉Python;

3、熟悉主流LLM/VLM/AIGC算法模型原理,了解混合专家(MoE)架构、低比特量化(如INT8/INT4/INT2)、SparseAttention等模型优化手段,有相关优化经验者优先;

4、具备CUDA/OpenCL/Metal中的至少1种GPU优化经验,熟悉TensorRT/Triton/CUTLASS,熟悉高通/MTK等NPU架构及部署方案,有丰富的ARM NEON汇编优化,有以上技术的AI工程优化部署经验者优先;

5、熟练掌握GPU(NVIDIA/Adreno/Mali/Apple)、CPU(ARM/x86)中的1个或多个平台的高性能计算优化技术,深入理解计算机体系结构,熟悉移动端/PC端/车端中一个或多个平台的并行计算优化、访存优化等;

6、熟悉常用深度学习推理计算库,例如Llama.cpp、MNN、TNN、CoreML等,熟悉计算密集型算子如FlashAttention、Conv2d、GEMM、GEMV实现和加速优先。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。