多模态大模型评测工程师-【可灵AI专项】
岗位信息
| 招聘单位 | 快手 |
|---|---|
| 官方更新时间 | 2026-07-09T14:10:27.000+08:00 |
职位描述
岗位亮点:
1、面向多模态大模型核心能力建设评测体系,覆盖文生图、图像编辑、caption/PE评测等方向;
2、既需要工程能力,也需要数据分析和模型效果理解,如果你没有相关经验,也适合希望从测试开发、数据工程、平台工程转向大模型评测方向的同学;
3、参与评测 Agent、模型竞技场、偏好模型、自动化机评、应用数据飞轮等前沿工具链建设;
4、工作结果直接影响模型迭代、产品体验和算法优化方向。
职位描述:
1、以算法视角,参与快手大模型文生图、图像编辑评测工作、算子评估和相关评测体系建设;
2、参与评测相关自动化评测工具开发及维护,最大化提高评测效率;
3、以算法手段,对基座大模型和AI Native应用进行分阶段、端到端评测;
4、参与构建评测Agent工具链、机评设计、对战平台、模型竞技场、模型效果判别模型、应用数据飞轮等工具链建设。
任职要求
1、本科及以上学历,计算机、人工智能、软件工程、数据科学、自动化等相关专业优先;
2、具备扎实的软件工程能力,能够独立完成评测工具、自动化流程、数据处理 pipeline 或平台系统的设计与实现;
3、具备较好质量意识,且对大模型、多模态模型、图像生成或图像编辑有兴趣,能够主动理解模型能力、模型缺陷与数据分布之间的关系;
4、具备较强的数据分析和问题归因能力,能够从评测结果、线上数据和用户行为中定位问题,并推动后续优化;
5、具备良好的沟通能力,能够与算法、数据、产品、平台团队协作,推动评测标准和工程方案统一;
6、具备以下任一方向经验即可:
○ 测试开发:有自动化测试、测试平台、质量体系、稳定性保障、效果评测相关经验;
○ 数据分析:有数据清洗、分布分析、指标建设、A/B test、实验分析相关经验;
○ 算法评测 / 模型评测:有 CV、多模态/LLM、AIGC、推荐、搜索、广告等模型评测经验。
加分项:
1、有 AIGC、多模态大模型、图像生成、图像编辑、VLM、Agent 等相关项目经验;
2、有评测平台、对战平台、模型竞技场、自动化评测系统、数据飞轮建设经验;
3、熟悉 diffusion、VLM、LLM、prompt engineering、偏好模型、reward model、VLM-as-Judge 等相关概念;
4、熟悉 SuperCLUE、LMArena、GenAI-Bench、HEIM、T2I-CompBench、DPG-Bench、EditBench 等评测基准或方法论;
5、有较好的图像审美能力,能够从构图、风格、真实感、文字准确性、主体一致性、指令遵循等角度判断生成效果;
6、有复杂项目推进经验,能够跨团队推动评测标准、工具链或数据流程落地。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。