AI Agent算法评测工程师
岗位信息
| 招聘单位 | 蔚来 |
|---|---|
| 工作地点 | 上海、北京 |
| 经验要求 | 6 |
| 官方更新时间 | 2026-06-18 11:05:15 |
职位描述
搭建评测框架:构建针对RAG、Tool Calling、多步推理的自动化评测Pipeline,覆盖任务成功率与轨迹合理性。
裁判模型建设:落地LLM-as-a-Judge机制,解决打分偏差问题,实现Agent每日回归测试。
基准与数据集:维护业务评测黄金集,跟进行业Benchmark(如AgentBench),定期输出竞品对比报告。
缺陷归因:深度分析失败轨迹,区分是模型能力不足还是框架设计缺陷,推动底层优化。
任职要求
硬核技能:精通Python,熟悉Pytest,能独立搭建自动化测试工程。
懂大模型:熟悉RAG、Function Calling原理,擅长复杂Prompt设计与调优。
工程基础:熟悉Docker及CI/CD流水线,有数据分析(Pandas/可视化)能力。
加分项:有LLM-as-a-Judge实战经验;参与过AI应用的红队测试;熟悉LangChain或Dify源码。
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。