招聘公告 · 职位检索 · 央国企/事业单位/名企

AI评测专家 - 飞书

单位:字节跳动类别:测试类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位字节跳动
工作地点北京
官方更新时间2026-07-27 20:41:27

职位描述

团队介绍:飞书是字节跳动旗下 AI 工作平台,面向人与agent协作,提供一站式协同办公、组织管理、业务提效工具和深入企业场景的 AI 能力,让 AI 真能用真落地。

从互联网、高科技、消费零售到制造、金融、医疗健康,各行各业先进企业都在飞书落地AI,与飞书共创行业最佳实践。先进团队,AI用飞书。

1、负责AI Agent的评测体系建设,制定覆盖基础能力、业务效果、工具调用、任务执行、稳定性、安全性和用户体验的评测标准,根据业务场景设计评测集、评分规则和验收门槛,建立从离线评测、自动化评测到线上效果监控的完整评测链路;

2、设计并维护高质量评测数据集,负责样本采集、清洗、标注、分层、去重及版本管理,保障数据代表性、覆盖度和区分度;

3、建设自动化评测能力,综合使用规则、代码、模型裁判和人工专家完成多维评分,并持续提升评测结果的准确性与一致性;

4、建立失败案例归因体系,对幻觉、误判、漏答、工具调用失败、执行中断和结果不稳定等问题持续聚类,推动Top问题专项治理;

5、探索用户反馈、线上行为和业务结果与离线评测之间的关联,持续提升评测指标对真实用户体验的解释能力,跟踪业界评测方法和前沿技术,沉淀AI评测规范、最佳实践和方法论,推动评测能力在不同业务场景中复用。

任职要求

1、具备大模型评测、算法评测、数据分析、测试开发或AI产品质量相关经验,有自动化评测平台或评测流水线建设经验、复杂任务E2E评测、工具调用评测或Computer Use Agent评测经验优先;

2、熟悉大语言模型、AI Agent、RAG、工具调用、Prompt Engineering和模型推理的基本原理;

3、熟悉准确率、召回率、Pass@K、成对比较、评分量表、LLM-as-a-Judge和人工评测等常见评测方法;

4、具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验和结果分析;

5、具备较强的结构化分析和报告能力,能够从大量失败样本中提炼共性问题并提出。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。