招聘公告 · 职位检索 · 央国企/事业单位/名企

算法工程师 (高性能计算与大模型推理优化方向)

单位:优刻得类型:社招地点:上海市、深圳市更新:2026-09-24

岗位信息

招聘单位优刻得
工作地点上海市、深圳市
官方更新时间2025-12-25T17:27:29

职位描述

我们正在寻找一位对技术充满好奇心、渴望探索未知领域的算法工程师加入我们的团队。在这个岗位上,你将不再局限于应用层的模型调参,而是深入到从模型框架到底层硬件的完整调用链路中。你将负责剖析、优化并构建高性能的大模型推理与训练系统,同时为顶尖客户提供深度的技术支持。如果你热衷于探究 torch 乃至 cuda 底层的运行机制,并乐于解决复杂的工程难题,这里将是你施展才华的最佳舞台。

核心职责 (Key Responsibilities):

全链路性能优化与研究(核心重点):

深入研究并优化从上层框架(vLLM/Sglang)到 PyTorch,再到 CUDA/NCCL 以及底层硬件(GPU/网络互联)的完整调用链路。

针对大模型推理和分布式训练场景,搭建性能理论模型(Performance Modeling),识别系统瓶颈。

设计并实现精细化的性能监控系统,量化分析算力利用率(MFU/HFU)及通信开销。

深度技术支持与问题排查:

协助客户定位主流开源代码在推理或训练过程中遇到的复杂 Bug。

排查分布式环境下的机器故障(软硬件结合问题),保障集群稳定性。

为客户提供定制化的性能优化与加速方案,提升模型落地效率。

模型复现与微调实践:

基于 PyTorch 等框架,从零搭建或深度定制经典及前沿模型(如 Transformer 架构、Stable Diffusion、YOLO 等)。

负责相关模型的微调(Fine-tuning)与适配工作,验证优化策略的有效性。

任职要求

教育背景:

计算机科学、人工智能、计算机视觉、机器学习或相关领域的硕士或博士学位。

技术栈要求:

框架经验: 熟练掌握并实际使用过至少 2 种以上主流的模型推理或分布式训练框架(例如:vLLM, Sglang, Accelerate, Megatron-LM, DeepSpeed 等)。

编码与实现: 精通 Python/C++,具备扎实的 PyTorch 功底。必须具备从模型搭建开始实现 ResNet 或更先进模型(如 Transformer 系列、YOLO、Stable Diffusion)训练或微调的实际动手经验。

软性素质:

拥有极强的好奇心与探索欲,不满足于“知其然”,更追求“知其所以然”。

习惯挑战未知领域,具备在文档缺失或技术前沿地带独立解决问题的能力。

具备良好的沟通能力,能够清晰地向客户解释复杂的技术问题。

加分项 (Preferred Qualifications):

有高性能计算(HPC)、CUDA 算子编写或优化经验者优先。

熟悉 GPU 硬件架构(如 NVIDIA Ampere/Hopper)及互联技术(NVLink/InfiniBand)者优先。

有大规模分布式训练集群运维或性能调优工作经验者优先。

在 GitHub 上有高质量开源项目贡献,或在相关技术社区活跃者优先。

为什么加入我们?

硬核技术挑战: 你将直接面对大模型时代最核心的算力效率问题,工作内容极具技术深度。

全栈视野: 这是一个难得的机会,让你打通从算法应用到底层硬件的“任督二脉”,成为真正的全栈优化专家。

成长空间: 与一群同样充满好奇心和极客精神的伙伴共事,共同探索 AI 基础设施的边界。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。