视频生成算法工程师 (强化学习)
岗位信息
| 招聘单位 | 生数科技 |
|---|---|
| 工作地点 | 北京、上海、深圳 |
| 官方更新时间 | 2026-08-14 17:08:14 |
职位描述
负责视频生成模型的后训练算法,基于 reward model、人工偏好和自动评测信号,提升模型在文本对齐、审美、动态、稳定性和用户满意度上的综合表现:
1. 设计视频生成后训练流程,包括 SFT、DPO、diffusion RL 等。
2. 基于多维 RM 构建训练 reward,优化文本-视频对齐、运动质量、美感、主体一致性和崩坏率。
3. 探索 reward hacking 防御、多 reward balance、online/offline preference data mixing。
4. 支持 recaption model RL,探索基于 benchmark 或 RM 的 prompt rewriting 优化。
5. 与 RM / 评测团队协作,构建可用于训练的高质量 preference 数据。
6. 分析后训练带来的能力提升和副作用,推动稳定迭代。
任职要求
1. 熟悉 DPO、GRPO、NFT等经典 LLM / diffusion 后训练算法。
2. 有 LLM / diffusion 后训练、多模态 RL 经验优先。
3. 对 reward design、数据偏差、评测污染、reward hacking 有较深理解。
4. 能独立设计实验,并从复杂 case 中归因问题来源。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。