AI评测专家 - 飞书
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-07-27 20:41:27 |
职位描述
团队介绍:飞书是字节跳动旗下 AI 工作平台,面向人与agent协作,提供一站式协同办公、组织管理、业务提效工具和深入企业场景的 AI 能力,让 AI 真能用真落地。
从互联网、高科技、消费零售到制造、金融、医疗健康,各行各业先进企业都在飞书落地AI,与飞书共创行业最佳实践。先进团队,AI用飞书。
1、负责AI Agent的评测体系建设,制定覆盖基础能力、业务效果、工具调用、任务执行、稳定性、安全性和用户体验的评测标准,根据业务场景设计评测集、评分规则和验收门槛,建立从离线评测、自动化评测到线上效果监控的完整评测链路;
2、设计并维护高质量评测数据集,负责样本采集、清洗、标注、分层、去重及版本管理,保障数据代表性、覆盖度和区分度;
3、建设自动化评测能力,综合使用规则、代码、模型裁判和人工专家完成多维评分,并持续提升评测结果的准确性与一致性;
4、建立失败案例归因体系,对幻觉、误判、漏答、工具调用失败、执行中断和结果不稳定等问题持续聚类,推动Top问题专项治理;
5、探索用户反馈、线上行为和业务结果与离线评测之间的关联,持续提升评测指标对真实用户体验的解释能力,跟踪业界评测方法和前沿技术,沉淀AI评测规范、最佳实践和方法论,推动评测能力在不同业务场景中复用。
任职要求
1、具备大模型评测、算法评测、数据分析、测试开发或AI产品质量相关经验,有自动化评测平台或评测流水线建设经验、复杂任务E2E评测、工具调用评测或Computer Use Agent评测经验优先;
2、熟悉大语言模型、AI Agent、RAG、工具调用、Prompt Engineering和模型推理的基本原理;
3、熟悉准确率、召回率、Pass@K、成对比较、评分量表、LLM-as-a-Judge和人工评测等常见评测方法;
4、具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验和结果分析;
5、具备较强的结构化分析和报告能力,能够从大量失败样本中提炼共性问题并提出。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。