招聘公告 · 职位检索 · 央国企/事业单位/名企

多模态视频生成数据与算法工程师(RLHF方向)-【可灵AI】

单位:快手类型:社招更新:2026-09-24

岗位信息

招聘单位快手
官方更新时间2026-06-09T11:09:55.000+08:00

职位描述

1、负责多模态视频生成模型的 RLHF 数据体系建设与工程落地,围绕运动质量、文本对齐、画面稳定性、风格一致性等核心业务指标,构建可规模化、可迭代的数据生产与交付流程;

2、设计并实现面向视频生成的 偏好建模与 Reward 机制,将主观质量(美感、合理性、符合指令等)转化为稳定、可优化的训练信号,推动模型在真实场景中的持续提升;

3、在生产环境中落地 DPO / GRPO / ReFL / PPO 等后训练与强化学习方法,结合数据策略与算法设计,提升模型效果并控制训练成本与稳定性;

4、深度对齐业务目标(如生成质量、用户满意度、场景可用性、内容安全等),以 “数据 + 算法 + 评测”闭环驱动模型迭代,对关键指标提升结果负责;

5、与算法、工程、数据、产品及运营团队紧密协作,建设 自动化数据管线、评测与回归体系,确保 RLHF 能在多模型、多版本中稳定复用与规模化落地。

任职要求

1、硕士及以上学历,具备扎实的工程能力与算法背景,对多模态大模型、视频生成和模型后训练有强烈兴趣;

2、以核心成员身份参与过 RLHF/偏好数据构建或后训练项目,熟悉数据采集、送标、质检、评测、训练、回归的完整链路;

3、在图像或视频生成任务中,具备 DPO / GRPO / ReFL / PPO 等方法的实际工程经验,理解算法效果、稳定性与成本之间的权衡;

4、熟悉计算机视觉基础与生成建模(图像/视频生成、时序建模、VLM 等),具备VLM微调经验;

5、具备良好的跨团队协作与问题拆解能力,能够在复杂业务环境中推动方案落地,对结果负责。

加分项:

1、有大规模数据生产系统、自动化评测体系、Reward Model 设计 或 RLHF 工程化落地经验;

2、参与过线上模型迭代,对效果指标(质量、稳定性、用户满意度、安全性等) 有可量化的实际提升;

3、在ACM/ICPC、Kaggle 等竞赛中取得优异成绩,或在多模态生成、强化学习、大模型工程领域主导过关键项目。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。