大模型训练工程师(LLM Training Engineer)
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-05-29T20:05:06.000+08:00 |
职位描述
【关于我们】
我们全面打造 AI Infra:大模型训练、推理引擎,为公司核心大模型(基模+MaaS)场景提供高速、稳定、可扩展、低成本的大模型训练与推理服务;
在这里,你将参与推动分布式训练、强化学习(RL)、微调(SFT)、算子优化、混合精度与量化加速、KV Cache 管理、推理调度与 Pipeline 优化等前沿技术落地,让训练更快、推理更省、交付更稳;
【职位描述】
1、负责大模型训练框架与训练平台的研发与演进,支撑万亿级参数模型训练落地;
2、负责分布式训练方案设计与优化(DP/TP/PP/ZeRO/FSDP/MoE 等),提升吞吐与资源利用率;
3、负责训练性能调优,包括算子优化、混合精度(BF16/FP16/FP8)、显存优化、通信优化与 pipeline overlap;
4、负责训练稳定性建设,包括容错恢复、监控告警、性能回归、训练诊断与自动化运维能力;
5、参与强化学习训练框架与对齐训练流程建设,支持 RLHF/PPO/DPO/GRPO 等训练任务的工程优化与平台化落地;
6、跟进前沿训练系统技术,推动在业务场景规模化落地。
任职要求
1、本科及以上学历,计算机/软件/电子相关专业;
2、熟练掌握 Python/C++,具备扎实的工程能力与系统调试能力;
3、熟悉 PyTorch 训练机制,理解反向传播、梯度同步、显存管理等原理;
4、熟悉分布式训练框架(Megatron-LM/DeepSpeed/FSDP 等)并具备实战经验;
5、熟悉 GPU/NPU 性能优化方法,能独立完成 profiling 与瓶颈定位(Nsight/perf 等);
6、熟悉训练侧算力优化技术,包括算子融合、图优化、Triton/CUDA Kernel 开发、编译器优化等;
7、了解强化学习训练基本流程与常见框架,熟悉 rollout、reward model、policy update 等机制者优先;
8、具备良好的问题分析能力与跨团队协作能力。
加分项:
1、有 MoE/长序列/多机多卡大规模训练经验;
2、熟悉 NCCL/HCCL/RDMA/IB 通信优化;
3、有量化训练、低比特训练或 QAT(Quantization-Aware Training)相关实践经验;
4、有国产卡适配与性能优化经验(昇腾/寒武纪/沐曦等);
5、有开源贡献或高性能系统相关论文/专利。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。