评测工程师 - 智能体方向
岗位信息
| 招聘单位 | 面壁智能 |
|---|---|
| 工作地点 | 北京 |
| 官方更新时间 | 2026-09-13 10:53:45 |
职位描述
1. 评测体系搭建:从0到1搭建覆盖基础模型与应用模型的评测体系,包含评测集构建、评估流程设计、评估指标定义等,推动评测方法论持续迭代,弥补目前在商业化评测、人评/体感评测、黑盒评测等维度的空白;
2. 自动化平台建设:设计并落地端到端的评测自动化Pipeline,提升评测效率和覆盖度,避免人力高成本、低效率的模式;
3. 开源Benchmark集成与自研:完善开源benchmark的集成工作,同时针对公司模型特点建设自研评测集,确保评测能有效暴露模型问题并引导迭代方向;
4. 评测结论驱动模型优化:建立评测到模型迭代的闭环机制,确保评测不只是“打分”,而是转化为可落地的模型优化建议,推动模型能力提升;
5. 团队建设与管理:组建并管理评测团队(目标10人左右),涵盖开源评测、商业化评测、人评/体感评测、黑盒评测等模块;
6. 跨部门协同:与文本、多模态+具身、语音、平台等协作,评测结论能有效赋能各项目组;
7. 中立裁判角色:以客观、权威的视角进行红蓝对抗式评测,不怕Say No,避免“内部一片peace”但模型实际能力不够。
任职要求
硬性要求
- 技术出身:有模型训练或算法背景,对模型有深度认知,理解评测方式如何引导模型迭代;
- 大模型评测经验:有基础模型评测体系搭建经验,熟悉LLM/多模态/语音等模型评测维度和方法论;
- 系统化能力:能够从0到1搭建评测体系,完成从idea到方案到执行的全流程;
- 自动化平台建设能力:有评测自动化平台建设经验,能够将人工评测流程抽象为可复用的平台能力。
软性要求
- Aggressive且有判断力:敢于以红蓝对抗心态审视模型,不因内部压力而妥协评测标准,不怕得罪人;
- 沟通协调能力强:在保持中立权威的同时,能够与各模型团队良性协作,不造成内耗;
- 管理能力:有团队管理经验,能有效分配任务、培养团队。
加分项
- 有从0到1搭建评测团队的经历
- 了解多模态评测、Agent评测、RAG评测等前沿方向
- 有模型发版评审、安全合规评测经验
提示:投递请认准招聘单位官方招聘官网,谨防中介收费。