招聘公告 · 职位检索 · 央国企/事业单位/名企

Agent稳定性测试工程师

单位:美团类别:测试类型:社招地点:北京市、成都市更新:2026-09-24

岗位信息

招聘单位美团
部门/事业群核心本地商业-基础研发平台
工作地点北京市、成都市
官方更新时间1787208601000

职位描述

负责 CatPaw Agent 稳定性测试和评测体系建设,设计并实现覆盖 Skill/Plugin、工具调用、端到端任务完成度的评测框架与自动化测试基建,支撑模型与策略选型决策,以及持续量化并提升开发者体验。

面向 CatPaw 多智能体集群构建运行时评测能力,针对路由调度、会话管理、记忆系统等模块设计场景化用例集与回归基线,识别多轮长链路下的能力衰减与稳定性风险。

主导长程任务 harness 效果评估工作,围绕Prompt 工程、tool Calling 、上下文管理、以及memory能力建立指标体系,评测驱动Agent持续优化。

主导CatPaw Agent产品需求交付质量保障、AI自动化测试开发,保障Agent产品的高质量高效上线。

覆盖 IM/社交/办公等多端渠道及浏览器自动化场景的真实链路验收,badcase分析,沉淀可复用的场景数据集与自动化巡检能力,推动线上质量可观测,以及数据飞轮建设。

参与安全与合规评测,针对多租户权限隔离、数据沙箱、越权与提示注入等风险构建红队用例与对抗性评测方案,保障系统安全性与稳定性。

任职要求

大学本科及以上学历,3 年以上研发或质量工程经验,精通 TypeScript/Node.js 或 Python,具备较强的工程实现能力。

重度 AI Coding 用户,熟练使用 CatPaw/NoCode/Cursor/CC/CodeX 等 AI 编程工具完成日常开发与评测脚本建设。

深入理解 LLM 应用开发,掌握 Prompt 设计、Tool Use、RAG 等核心技术,理解其常见失效模式与对应的评估手段。

熟悉大模型评测方法论,包括自动化评测、LLM-as-a-Judge、人工标注与抽样、A/B 实验与统计显著性判断,能设计出可复现、低噪声的评测流程。

具备平台或框架级系统设计能力,能独立完成评测平台核心模块的架构与实现,并推动数据驱动的质量改进落地。

具备自驱力,善于与 AI 协作,主动探索技术边界并推动结论转化为产品迭代。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。