招聘公告 · 职位检索 · 央国企/事业单位/名企

Agent 评测产品经理

单位:美团类别:产品类型:社招地点:北京市、上海市更新:2026-09-24

岗位信息

招聘单位美团
部门/事业群核心本地商业-基础研发平台
工作地点北京市、上海市
官方更新时间1789543674000

职位描述

CatPaw 是面向工作与生产场景的 AI Agent 产品矩阵,覆盖通用办公、云端助理、AI 编程、NoCode 应用生成及企业级 Agent 平台。我们正在寻找一位对 AI 产品效果高度敏感、兼具产品判断力和技术理解力的产品经理。你将负责 CatPaw 系列产品的效果评测、同类产品对标和持续调优,建立从“发现差距—定位原因—推动优化—验证结果”到“沉淀标准”的完整闭环。

1、负责 CatPaw 系列产品的效果评测体系建设,覆盖通用办公 Agent、云端助理、Coding Agent、NoCode 及企业级 Agent 等产品方向。

2、根据真实用户场景建立任务分类、评测数据集、评分标准和基准线,持续完善离线评测、人工评测、自动化评测和在线效果观测机制。

3、持续跟踪国内外主流 AI Agent 产品,设计公平、可复现的横向对比方案,评估任务完成质量、成功率、稳定性、交互体验、执行效率、成本及安全性等关键维度。

4、深入分析评测失败案例和用户负反馈,结合会话、Trace、模型输出及工具调用过程,判断问题来自模型、Prompt、上下文、知识库、工具、Skill、执行环境还是产品交互。

5、与算法、研发、设计及业务团队协作,推动模型策略、Agent Harness、Prompt、Context、Memory、RAG、工具调用和交互体验等方向的调优。

6、设计并推动 A/B 实验、回归测试和版本验收,验证优化方案的真实收益,避免局部指标提升但整体用户体验下降。

7、将评测结果转化为清晰的产品判断和优先级建议,为产品路线图、模型选型、能力建设及版本发布提供决策依据。

任职要求

1、3 年以上 AI、开发者工具、企业软件或效率产品相关经验,其中至少 1 年大模型或 AI Agent 产品经验。

2、深度使用过多款国内外大模型及 Agent 产品,能够识别“看起来能完成”和“真实场景下稳定完成”之间的差异。

3、理解大模型及 Agent 的基本工作机制,熟悉 Prompt、Context、RAG、Memory、Tool Calling、MCP、Skills、Sandbox 等概念。

4、具备较强的评测设计能力,能够将模糊的“效果好不好”拆解为可执行的测试任务、评价维度和度量指标。

5、具备良好的数据分析和问题归因能力,能够从大量案例中识别共性问题,并提出可验证的优化假设。

6、有较强的动手能力和好奇心,愿意高频体验产品、复现问题,并持续跟踪快速变化的 AI 产品与技术趋势。

前往官方投递

提示:投递请认准招聘单位官方招聘官网,谨防中介收费。