视频生成大模型Tech Lead
岗位信息
| 招聘单位 | momenta |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-03-04 14:42:33 |
职位描述
职位描述
视频生成模型研发:负责面向自动驾驶场景的视频生成大模型的算法设计与优化,探索 Diffusion/Flow Matching 等主流生成范式在驾驶场景视频合成中的应用与改进。
世界模型方向探索:以视频生成能力为基础,研究并构建自动驾驶世界模型,实现对驾驶场景的可控生成、未来帧预测与物理合理性建模,为端到端自动驾驶研发提供数据与仿真支撑。
可控生成与条件建模:研究多种条件控制方式(如轨迹条件、摄像头位姿、地图结构、天气/光照等)下的视频生成方案,提升生成内容的几何一致性、时序连贯性与场景多样性。
任职要求
基本条件
计算机科学、人工智能、计算机视觉或相关领域硕士及以上学历。
2年以上深度学习/计算机视觉相关研发经验,有视频生成或图像生成大模型方向研发背景。
核心技术要求
深入理解主流视频/图像生成模型架构,熟悉以下一项或多项:
Diffusion Model(DDPM、DDIM、LDM 等)
Flow Matching / Rectified Flow
DiT(Diffusion Transformer) 及其视频扩展
VAE / Tokenizer 在视频压缩与重建中的应用
熟悉视频生成领域主流工作(如 Sora、CogVideo、Open-Sora、SeedAnce、通义万相、Wan 等),对其技术方案有深入理解。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。