招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型训练工程师(LLM Training Engineer)

单位:快手类型:社招更新:2026-09-24

岗位信息

招聘单位快手
官方更新时间2026-05-29T20:05:06.000+08:00

职位描述

【关于我们】

我们全面打造 AI Infra:大模型训练、推理引擎,为公司核心大模型(基模+MaaS)场景提供高速、稳定、可扩展、低成本的大模型训练与推理服务;

在这里,你将参与推动分布式训练、强化学习(RL)、微调(SFT)、算子优化、混合精度与量化加速、KV Cache 管理、推理调度与 Pipeline 优化等前沿技术落地,让训练更快、推理更省、交付更稳;

【职位描述】

1、负责大模型训练框架与训练平台的研发与演进,支撑万亿级参数模型训练落地;

2、负责分布式训练方案设计与优化(DP/TP/PP/ZeRO/FSDP/MoE 等),提升吞吐与资源利用率;

3、负责训练性能调优,包括算子优化、混合精度(BF16/FP16/FP8)、显存优化、通信优化与 pipeline overlap;

4、负责训练稳定性建设,包括容错恢复、监控告警、性能回归、训练诊断与自动化运维能力;

5、参与强化学习训练框架与对齐训练流程建设,支持 RLHF/PPO/DPO/GRPO 等训练任务的工程优化与平台化落地;

6、跟进前沿训练系统技术,推动在业务场景规模化落地。

任职要求

1、本科及以上学历,计算机/软件/电子相关专业;

2、熟练掌握 Python/C++,具备扎实的工程能力与系统调试能力;

3、熟悉 PyTorch 训练机制,理解反向传播、梯度同步、显存管理等原理;

4、熟悉分布式训练框架(Megatron-LM/DeepSpeed/FSDP 等)并具备实战经验;

5、熟悉 GPU/NPU 性能优化方法,能独立完成 profiling 与瓶颈定位(Nsight/perf 等);

6、熟悉训练侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel 开发、编译器优化等;

7、了解强化学习训练基本流程与常见框架,熟悉 rollout、reward model、policy update 等机制者优先;

8、具备良好的问题分析能力与跨团队协作能力。

加分项:

1、有 MoE/长序列/多机多卡大规模训练经验;

2、熟悉 NCCL/HCCL/RDMA/IB 通信优化;

3、有量化训练、低比特训练或 QAT(Quantization-Aware Training)相关实践经验;

4、有国产卡适配与性能优化经验(昇腾/寒武纪/沐曦等);

5、有开源贡献或高性能系统相关论文/专利。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。