AI 测试工程师
岗位信息
| 招聘单位 | 零一万物 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-09-18 14:03:48 |
职位描述
主要负责重点企业 Agent 项目的测试与评测交付,主导 B 端评测体系建设,并参与评测 Harness 和通用评测平台建设。既能在项目中动手解决问题,也能把经验沉淀为方法、工具和平台能力。
岗位职责
1、负责重点企业 Agent 项目的测试与评测交付
-作为领域主 R,制定测试策略、评测方案和验收标准;
-理解客户业务和使用场景,识别关键质量风险;
-推动产品、算法、研发和交付团队解决问题;
-输出可用于上线、交付和客户验收的评测结论与改进建议。
-负责 AI/Agent 全链路测试与评测
-覆盖大模型应用、知识库检索、Agent、工具调用、多轮对话和工作流;
-设计人工评测、自动评测和模型辅助评分相结合的评测方案;
-处理结果波动、上下文干扰、工具选择错误等问题;
-根据日志和调用链分析失败原因,推动问题修复和回归验证。
2、主导 B 端 Agent 评测体系建设
-建立质量指标、评测数据集和人工评测标准;
-建设标准集、回归集、难题集及覆盖度评估机制;
-建立评测基线、版本对比、上线门槛和线上问题回流机制;
-沉淀可复用的领域评测方案、模板和最佳实践。
3、建设评测 Harness 和通用评测平台
-建设或完善 Harness,支持测试场景加载、批量执行、模型与 Agent 调用、结果收集、自动评分、版本对比和失败重跑;
-从重点项目中抽象共性需求,参与数据集管理、任务编排、结果分析和报告生成等平台能力建设;
-推动 Harness 与评测平台衔接,并在真实项目中落地使用;
-支持不同模型、提示词、Agent 和工作流版本的对比评测。
5、负责关键质量专项和工具建设
-推进稳定性、性能、安全及对抗测试等专项;
-开发测试与评测脚本、工具或平台组件,并应用到实际流程;
-利用 AI 工具提升用例生成、数据标注、异常挖掘和失败分析效率。
任职要求
1、5年以上测试、测试开发、质量或评测经验,2年以上 AI/Agent 评测经验;能独立负责复杂项目交付。
2、理解Harness,并有测试/评测Harness实践经验,能够完成执行、评分、结果汇总和回归对比。
3、熟悉 AI/Agent 评测方法,具备评测集建设、指标设计和人工与自动评测结合的经验。
4、了解知识库检索、Agent、工具调用、多轮对话和工作流,理解 AI 结果不稳定及其评测方法。
5、具备较强工程能力,掌握 Python,能够开发评测脚本、工具或平台组件。
6、有 B 端或企业级项目经验,理解数据隔离、权限管理、审计、发布回滚和私有化部署等质量要求。
7、具备体系化和平台化思维,能从项目中提炼通用需求,并推动跨团队落地。 8、有较强的主人翁意识和跨团队影响力,能够在没有管理权限的情况下推动结果。
加分项
1、有从 0 到 1 建设评测 Harness、评测平台或大型评测数据集的经验。
2、有 AI 安全、对抗测试、稳定性或性能专项治理经验。
3、熟悉主流评测框架、调用链分析工具或 AI 研发辅助工具。
4、有金融、政务、制造、零售、运营商、医疗等行业的企业 AI 项目经验
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。