【基座大模型北斗实习】开放域智能体交互与自动化评测演进机制研究
岗位信息
| 招聘单位 | 美团 |
|---|---|
| 工作地点 | 北京市、上海市 |
| 官方更新时间 | 1775223033000 |
职位描述
简介:随着 OpenClaw、Claude Code 等 Agent 进入实战领域,传统的静态评测已无法衡量 Agent 的长程规划、自主纠错与真实环境交互能力。我们寻找对 Agent 评测范式有独特见解的同学,共同定义下一代 Agent 的考卷。你将参与的工作有:
1、评测范式研究与落地:
①针对 OpenClaw 及 Claude Code 等主流 Agent,构建基于真实生产力场景,如自动化办公、复杂代码重构、多工具协同等的动态评测沙盒环境。
②探索从“单轮对话”转向“长程任务”的评测机制,研究如何量化 Agent 的记忆一致性与环境感知力。
2、高价值方案产出:
①设计并构建能反映用户体感的评测集,不仅关注 通过率,更深入拆解用户在交互过程中的使用体验。
②建立 Agent 错误归因体系,针对 Agent 陷入死循环、幻觉指令、工具调用失败等典型场景进行深度诊断。
3、未来形态探索:
①跟踪前沿 Agent 发展,研究在多智能体协同、自主进化等未来形态下的 Agent 形态和相应的评测基准。
②利用 LLM/Agent-as-a-Judge 的方式,提升自动化评测的准确性与效率。
任职要求
1、硕士及以上学历,计算机或相关专业,博士优先;
2、在 ML / NLP / RL / CV / Speech 等相关方向有扎实的研究基础,在 ACL / EMNLP / NAACL / NeurIPS / ICML / ICLR / CVPR / ICCV / ICASSP 等顶级会议发表论文者优先;
3、优秀的代码和算法功底,具备工匠精神,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
4、在大模型领域或强化学习领域,主导过大影响力的项目或论文者优先;
5、出色的问题分析和解决能力,有自主探索、深耕一个领域的决心和定力。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。