BSP开发工程师(具身AI软件架构)
岗位信息
| 招聘单位 | 德赛西威 |
|---|---|
| 工作地点 | 惠州、南京 |
| 官方更新时间 | 2026-08-17 10:47:39 |
职位描述
1,分析模型计算瓶颈,优化:Memory Access,Memory Footprint,Cache利用率,Kernel Fusion,算子融合,Tensor Layout
2,建立模型Benchmark体系,对模型进行:Latency,Throughput,FPS,Memory,功耗,Accuracy等指标评估。
3,提高模型在边缘设备和嵌入式平台上的部署效率。
4,研究并实现模型压缩算法,包括但不限于:网络剪枝(Pruning),知识蒸馏(Knowledge Distillation),模型稀疏化(Sparsity),参数共享,低秩分解(Low-rank Decomposition)
5,负责INT8、FP16、FP8、混合精度量化方案设计,解决量化精度下降问题。
6,基于TensorRT、ONNX Runtime、TVM、OpenVINO、TensorFlow Lite等推理框架进行性能优化。
7,针对GPU、NPU、DSP、CPU等不同硬件平台进行推理加速和Kernel优化。
任职要求
1,计算机、人工智能、电子、自动化相关专业本科及以上学历
2,熟练掌握Python、C++,熟悉Linux开发环境,熟悉Nvdia 开发生态
3,深度学习基础,熟悉至少一种深度学习框架:PyTorch,TensorFlow,PaddlePaddle
4,熟悉Profiling工具(如Nsight Systems,Nsight Compute,nvprof),能用来分析系统性能:GPU Utilization,CPU Utilization,Memory Usage,Cache Miss,Bandwidth,Thermal Power
5,模型量化熟悉:PTQ(Post Training Quantization),QAT(Quantization Aware Training),理解:Calibration,Observer,Fake Quantization,Symmetric Quantization,Asymmetric Quantization,Per Tensor/Per Channel/Dynamic Quantization
6,理解:CNN,Transformer,ViT,DETR,BEV,V/LLM,Diffusion
加分项
1,Graph Optimization,Operator Fusion,Kernel Fusion,Constant Folding,Tensor Fusion,Memory Reuse,GPU优化
2,具有以下平台部署经验之一:NVIDIA Jetson,NVIDIA Thor,intel Ultra,AMD P/X100
3,熟悉CUDA开发,有以下经验:TensorRT Plugin开发,CUDA Kernel开发,Triton Inference Server,TVM AutoScheduler,,OpenVINO,Vulkan Compute,OpenCL,CUTLASS,cuDNN,cuBLAS
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。