Agent策略产品(评测方向) - 豆包
岗位信息
| 招聘单位 | 字节跳动 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-09-01 14:33:41 |
职位描述
团队介绍:字节跳动豆包产品团队,在这里你将有机会参与到行业前沿产品的规划设计,开拓自己的行业视野,与先进团队共同成长。
1、负责Agent评测体系建设,规划重点场景、任务分层、评估指标和验收标准,持续跟踪行业进展并引入有效的评测方法;
2、深入企业和行业场景,与行业专家、客户、业务、产品及算法团队协作,理解真实工作流、交付物和验收方式,将高价值工作转化为可复现、可验证、有区分度的评测任务;
3、设计和维护高质量评测集,完整建设任务描述、输入材料、执行环境、参考产物、Rubrics、Verifier和隐藏测试,保障题目的真实性、覆盖度、难度、稳定性和可追溯性;建设高效的数据生产管线,打通线上任务与用户反馈、专家出题、企业共建、供应商采购和数据合成等来源,完成数据采集、清洗、改写、标注、质检、去重、分层及版本管理;
4、建设规模化自动评测能力,综合使用规则、代码、程序化验证、Agent Judger和专家评审,完成任务执行、产物解析、自动评分、人工校准、回归评测和评测集动态更新,持续提升评测的准确性、一致性和效率;
5、系统分析评测结果和失败案例,定位模型、Harness、Skill、工具、环境等环节的能力缺口,将结论转化为数据生产、模型训练和产品优化建议,并协同相关团队推动落地。
任职要求
1、本科及以上学历,具备大模型或Agent评测、数据建设、测试开发、AI产品质量、行业数字化等相关经验;
2、对真实业务场景有较强的理解和抽象能力,能够快速进入陌生行业,梳理复杂工作流并判断任务的业务价值、真实性和验收方式;
3、熟悉自动评测、评分量表、成对比较、Pass@K、程序化验证和LLM-as-a-Judge等常见评测方法,能够设计合理的评测实验;
4、具备数据分析和基础编程能力,能够使用Python、SQL等工具完成数据处理、评测实验及自动化流程建设;
5、具备优秀的结构化分析、沟通和项目推动能力,能够与行业专家、算法、数据、产品、平台及外部合作伙伴高效协作;
6、对Agent发展有持续热情,能够主动发现问题、验证假设,并在快速变化的领域中持续学习。
加分项:
1、在金融、医药、零售电商、增长营销、法律、工程等至少一个复杂行业拥有深入经验;
2、建设过真实任务Benchmark、自动化评测流水线或大规模数据生产管线;
3、有复杂端到端Agent、Computer Use、多工具执行、长程任务或任务环境构建经验;
4、有企业客户、行业专家、供应商或数据合作项目经验;
5、了解SFT、RL、数据合成和Reward设计,能够理解评测数据与模型优化之间的关系。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。