招聘公告 · 职位检索 · 央国企/事业单位/名企

AI 测试工程师

单位:零一万物类别:互联网 / 电子 / 网游类型:社招地点:北京更新:2026-09-24

岗位信息

招聘单位零一万物
工作地点北京
官方更新时间2026-09-18 14:03:48

职位描述

主要负责重点企业 Agent 项目的测试与评测交付,主导 B 端评测体系建设,并参与评测 Harness 和通用评测平台建设。既能在项目中动手解决问题,也能把经验沉淀为方法、工具和平台能力。

岗位职责

1、负责重点企业 Agent 项目的测试与评测交付

-作为领域主 R,制定测试策略、评测方案和验收标准;

-理解客户业务和使用场景,识别关键质量风险;

-推动产品、算法、研发和交付团队解决问题;

-输出可用于上线、交付和客户验收的评测结论与改进建议。

-负责 AI/Agent 全链路测试与评测

-覆盖大模型应用、知识库检索、Agent、工具调用、多轮对话和工作流;

-设计人工评测、自动评测和模型辅助评分相结合的评测方案;

-处理结果波动、上下文干扰、工具选择错误等问题;

-根据日志和调用链分析失败原因,推动问题修复和回归验证。

2、主导 B 端 Agent 评测体系建设

-建立质量指标、评测数据集和人工评测标准;

-建设标准集、回归集、难题集及覆盖度评估机制;

-建立评测基线、版本对比、上线门槛和线上问题回流机制;

-沉淀可复用的领域评测方案、模板和最佳实践。

3、建设评测 Harness 和通用评测平台

-建设或完善 Harness,支持测试场景加载、批量执行、模型与 Agent 调用、结果收集、自动评分、版本对比和失败重跑;

-从重点项目中抽象共性需求,参与数据集管理、任务编排、结果分析和报告生成等平台能力建设;

-推动 Harness 与评测平台衔接,并在真实项目中落地使用;

-支持不同模型、提示词、Agent 和工作流版本的对比评测。

5、负责关键质量专项和工具建设

-推进稳定性、性能、安全及对抗测试等专项;

-开发测试与评测脚本、工具或平台组件,并应用到实际流程;

-利用 AI 工具提升用例生成、数据标注、异常挖掘和失败分析效率。

任职要求

1、5年以上测试、测试开发、质量或评测经验,2年以上 AI/Agent 评测经验;能独立负责复杂项目交付。

2、理解Harness,并有测试/评测Harness实践经验,能够完成执行、评分、结果汇总和回归对比。

3、熟悉 AI/Agent 评测方法,具备评测集建设、指标设计和人工与自动评测结合的经验。

4、了解知识库检索、Agent、工具调用、多轮对话和工作流,理解 AI 结果不稳定及其评测方法。

5、具备较强工程能力,掌握 Python,能够开发评测脚本、工具或平台组件。

6、有 B 端或企业级项目经验,理解数据隔离、权限管理、审计、发布回滚和私有化部署等质量要求。

7、具备体系化和平台化思维,能从项目中提炼通用需求,并推动跨团队落地。 8、有较强的主人翁意识和跨团队影响力,能够在没有管理权限的情况下推动结果。

加分项

1、有从 0 到 1 建设评测 Harness、评测平台或大型评测数据集的经验。

2、有 AI 安全、对抗测试、稳定性或性能专项治理经验。

3、熟悉主流评测框架、调用链分析工具或 AI 研发辅助工具。

4、有金融、政务、制造、零售、运营商、医疗等行业的企业 AI 项目经验

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。