强化学习框架研发工程师-【可灵】
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-07-31T10:47:20.000+08:00 |
职位描述
1. 参与强化学习框架底座研发,面向生成理解统一与 Diffusion 场景下的 Agentic RL,提供高吞吐、易用、可扩展的训练与推理能力;
2. 针对 Agentic RL / Diffusion Agentic RL 做训推一体化优化,重点保障训推一致性,并推进 Flow GRPO、Refl 等算法在框架侧的高效落地;
3. 优化推理侧长尾问题,深入 KV Cache 管理、调度与资源复用等路径,持续提升在线与离线推理稳定性与效率;
4. 调研并落地业界最新 RL / 训推技术与性能工具,完成与训练、推理、分布式等框架的对接与集成。
任职要求
1. 具备良好的团队协作能力,热爱钻研技术,善于分析并解决复杂工程问题;
2. 有深度学习与强化学习基础,熟悉 Transformer / GPT 等模型结构,了解 RLHF / Agentic RL 相关范式更佳;
3. 对开源强化学习框架(如 veRL Omni、slime 等)有深入了解,有二次开发或性能优化经验者优先;
5. 对推理框架(如 vLLM、SGLang 等)有较深入了解,熟悉 KV Cache、调度与长尾优化相关实践;
6. 对训练框架(如 TorchTitan、Megatron 等)有较深入了解,具备分布式训练或 HPC 基础;
7. 对分布式框架(如 Ray 等)有较多了解,熟悉集合通信更佳;了解 CUDA 编程者优先。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。