招聘公告 · 职位检索 · 央国企/事业单位/名企

多模态大模型评测工程师-【可灵AI专项】

单位:快手类型:社招更新:2026-09-24

岗位信息

招聘单位快手
官方更新时间2026-07-09T14:10:27.000+08:00

职位描述

岗位亮点:

1、面向多模态大模型核心能力建设评测体系,覆盖文生图、图像编辑、caption/PE评测等方向;

2、既需要工程能力,也需要数据分析和模型效果理解,如果你没有相关经验,也适合希望从测试开发、数据工程、平台工程转向大模型评测方向的同学;

3、参与评测 Agent、模型竞技场、偏好模型、自动化机评、应用数据飞轮等前沿工具链建设;

4、工作结果直接影响模型迭代、产品体验和算法优化方向。

职位描述:

1、以算法视角,参与快手大模型文生图、图像编辑评测工作、算子评估和相关评测体系建设;

2、参与评测相关自动化评测工具开发及维护,最大化提高评测效率;

3、以算法手段,对基座大模型和AI Native应用进行分阶段、端到端评测;

4、参与构建评测Agent工具链、机评设计、对战平台、模型竞技场、模型效果判别模型、应用数据飞轮等工具链建设。

任职要求

1、本科及以上学历,计算机、人工智能、软件工程、数据科学、自动化等相关专业优先;

2、具备扎实的软件工程能力,能够独立完成评测工具、自动化流程、数据处理 pipeline 或平台系统的设计与实现;

3、具备较好质量意识,且对大模型、多模态模型、图像生成或图像编辑有兴趣,能够主动理解模型能力、模型缺陷与数据分布之间的关系;

4、具备较强的数据分析和问题归因能力,能够从评测结果、线上数据和用户行为中定位问题,并推动后续优化;

5、具备良好的沟通能力,能够与算法、数据、产品、平台团队协作,推动评测标准和工程方案统一;

6、具备以下任一方向经验即可:

○ 测试开发:有自动化测试、测试平台、质量体系、稳定性保障、效果评测相关经验;

○ 数据分析:有数据清洗、分布分析、指标建设、A/B test、实验分析相关经验;

○ 算法评测 / 模型评测:有 CV、多模态/LLM、AIGC、推荐、搜索、广告等模型评测经验。

加分项:

1、有 AIGC、多模态大模型、图像生成、图像编辑、VLM、Agent 等相关项目经验;

2、有评测平台、对战平台、模型竞技场、自动化评测系统、数据飞轮建设经验;

3、熟悉 diffusion、VLM、LLM、prompt engineering、偏好模型、reward model、VLM-as-Judge 等相关概念;

4、熟悉 SuperCLUE、LMArena、GenAI-Bench、HEIM、T2I-CompBench、DPG-Bench、EditBench 等评测基准或方法论;

5、有较好的图像审美能力,能够从构图、风格、真实感、文字准确性、主体一致性、指令遵循等角度判断生成效果;

6、有复杂项目推进经验,能够跨团队推动评测标准、工具链或数据流程落地。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。