招聘公告 · 职位检索 · 央国企/事业单位/名企

大模型Infra工程师 (大模型后训练)

单位:生数科技类别:研发类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位生数科技
工作地点北京
官方更新时间2026-08-20 15:50:34

职位描述

负责生成式大模型后训练阶段(SFT 微调 → 偏好对齐 → 强化学习)的训练基础设施设计与优化。面对算法快速迭代与大规模探索式采样的双重挑战,构建高效、灵活、可扩展的训练框架,在算法演进与系统效率之间实现最优平衡。

1. 后训练全链路框架设计与演进:主导设计并持续迭代后训练基础设施,完整覆盖 SFT(监督微调)→ RM(奖励模型训练)/ DPO(离线偏好优化)→ PPO / GRPO / DAPO(在线强化学习) 的对齐链路。面向算法快速演进的需求,构建模块化、可插拔的框架架构,实现新算法的高效接入与快速验证。

2. 大规模 Rollout 采样系统优化:针对在线 RL 训练中 Policy 模型频繁生成(Rollout)带来的海量推理请求,设计高效的采样调度系统。优化推理与训练之间的数据流转管道,实现生成、奖励打分、梯度更新三大环节的流水线并行与无缝衔接。

3. 混合资源调度与弹性训练:解决后训练场景下推理(Rollout)与训练(Gradient Update)对 GPU 资源的竞争问题。设计灵活的资源分配与弹性扩缩容策略,根据算法阶段动态调整推理与训练的算力配比,实现集群利用率的全局最优。

4. 训练稳定性与性能调优:保障大规模 RL 训练的稳定性,解决分布式环境下的探索多样性、奖励尺度震荡及训练崩溃等系统性问题。持续优化全链路吞吐,在极致的迭代速度与训练收敛性之间取得平衡。

任职要求

1. 算法理解与系统转化能力:深刻理解 SFT、DPO、PPO、GRPO、DAPO 等主流后训练算法的数学原理与计算模式,熟悉 Reward Model 的训练范式及其在 RL 链路中的角色,能够从算法特性出发设计系统架构。理解不同算法阶段对 Infra 的差异化诉求。

2. 框架实战经验:深度使用或精读过 veRL、OpenRLHF、TRL 等开源 RL 训练框架之一的核心源码。有在大规模(百卡/千卡级)集群上落地 RL 训练的实际经验,熟悉其中的分布式采样、经验回放、优势估计等关键模块的实现与瓶颈。

3. 系统架构能力:熟悉推理与训练混合部署的架构模式(如 SGLang/vLLM + 训练框架的混合调度),理解两者之间的显存隔离、通信隔离与任务编排策略。

4. 性能优化方法论:具备从端到端视角进行性能压榨的能力,能够精准定位采样瓶颈、数据传输瓶颈与训练瓶颈,并在迭代速度与训练效果之间进行系统级的权衡决策。

5. 加分项:

- 有视觉/多模态生成模型的后训练(SFT/RM/DPO/RL)落地经验

- 具备优秀的 SFT 阶段调参经验与数据配比/构建经验,深刻理解 SFT 质量对后续 RM 训练及 RL 收敛效果的影响

- 熟悉在线 RL 与离线 RL 的 Infra 差异,并有实际调优经验

- 有自研或深度定制 RL 训练框架的经历

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。