跳转至

智能体评测基准测试

概述

智能体基准测试(Agent Benchmark)用于评测 AI 系统在复杂、多步骤任务上的表现,涵盖规划、工具调用与自主决策能力。与仅单独考察知识和推理的 LLM 基准测试不同,智能体基准测试在贴近真实的环境中评估端到端任务完成能力。

通用智能体基准测试

GAIA

资源GAIA: HF Benchmarking General AI Agents

GAIA(General AI Assistants)是一个通用 AI 智能体评测基准,覆盖多类需要多步推理、工具调用和真实世界知识的任务。任务设计对人类来说较为简单,但对 AI 系统颇具挑战,要求具备网页浏览、文件处理和多模态推理能力。

核心特性: - 三个难度等级(Level 1、2、3) - 任务需要工具调用(网页搜索、代码执行、文件读取) - 人类基准线:约 92% 准确率;顶尖 AI 系统:约 50–70% - 托管于 Hugging Face,设有公开排行榜

Terminal Bench

资源Terminal Bench

专为在终端/命令行环境中运行的 AI 智能体设计的综合性基准测试,考察智能体在系统管理、文件操作、进程管理和 Shell 脚本编写等任务上的能力。

核心特性: - 在真实终端环境中执行任务 - 任务难度从基础文件操作到复杂系统管理不等 - 同时评估解决方案的正确性与效率 - 适用于编码智能体和 DevOps 自动化场景

TerminalBench-2

Terminal Bench 的扩展版本,用于评测智能体编码中运行框架层面的改进,包含 89 个 Docker 化任务,覆盖多样化的技术领域。Terminal-Bench 2.0 的任务以 Harbor 任务格式实现,并通过 Harbor 运行框架执行——Harbor 重构了原始的 Terminal-Bench 运行框架,以支持云部署容器和厂商无关的智能体接口。

核心特性: - 89 个 Docker 化任务,涵盖代码翻译、分布式 ML 配置、系统编程、生物信息学和密码分析 - 测试整个智能体运行框架(harness)——包括系统提示词、工具、完成检查逻辑和上下文管理——而非仅评估模型能力 - 被 Meta-Harness 论文采用,证明自动发现的运行框架优于手工设计的基线(Terminus 2、Terminus-KIRA) - 适用于评估运行框架优化方案,而非仅用于模型选型 - 强基线:Terminus 2 和 Terminus-KIRA 提供了手工设计的编排范式 - 官方运行框架:Harbor —— 支持在分布式云沙箱提供方上,用 Claude Code、OpenHands、Codex CLI 等智能体跑该任务集

Terminal-Bench 2.1

资源Terminal Bench

TerminalBench-2 的增量更新版本,扩展了任务集、改进了 Docker 化环境,并优化了评测方法。在保持与 TerminalBench-2 基线向后兼容的同时,增加了对新技术领域的覆盖。

核心特性: - 在 TerminalBench-2 的 89 个任务基础上扩展了任务数量,并新增领域 - 提升了 Docker 环境的稳定性和可复现性,使自动评分更加可靠 - 优化了完成检查逻辑,减少通过/失败判定中的模糊边界情况 - 持续评估完整的智能体运行框架,而非孤立的模型能力 - 与 TerminalBench-2 结果可向后对比,便于纵向追踪智能体进展 - 与 TerminalBench-2 运行在同一个 Harbor 运行框架上

METR(模型评测与威胁研究)

资源METR

METR 是一个研究机构,专注于开发和运行对前沿 AI 系统在无人干预情况下完成复杂任务能力的评测。其核心关注点是自主能力评估,服务于安全研究,特别是评估 AI 系统是否能执行可能被滥用并造成风险的任务。

核心特性: - 聚焦长时域自主任务 - 以安全为导向的评测方法论 - 被主要 AI 实验室用于预部署评估 - 评估需要持续数小时自主运行的任务

网页与计算机交互基准测试

VisualWebArena

资源VisualWebArena

面向多模态智能体的基准测试,考察智能体同时利用视觉和文字信息与网页界面交互的能力。在 WebArena 基础上新增视觉理解要求,测试智能体在需要解读截图和 UI 元素的真实网页任务上的表现。

核心特性: - 多模态(视觉 + 文本)智能体评测 - 真实网页应用环境(购物、论坛、分类信息) - 任务需要理解可视化 UI 元素 - 衡量任务完成率与执行效率

OSWorld

资源OSWorld Benchmark for Multimodal Agents

针对真实计算机环境中开放式任务的多模态智能体基准测试。智能体通过截图及键盘/鼠标操作与真实操作系统(Windows、macOS、Ubuntu)交互,全面考察现实计算机使用能力。

核心特性: - 真实 OS 环境(非模拟) - 任务涵盖网页浏览、办公应用、编码和文件管理 - 评估像人类一样控制计算机的智能体 - 适用于计算机使用类智能体(如 Claude Computer Use、Operator)

OSWorld-Verified

OSWorld 任务的精选子集,经人工标注者验证每个任务均可明确求解,且自动评测函数能产生准确结果。旨在提供比完整 OSWorld 集更高质量、更低噪声的评测信号。

核心特性: - 人工验证任务可解性——减少因任务无法回答或描述模糊导致的假阴性 - 经标注者验证的准确评测函数——减少因评分器缺陷导致的假阳性 - 当基准测试可靠性比覆盖广度更重要时,优先于完整 OSWorld 集使用 - 理念上类似于 SWE-bench Verified:以精心筛选的正确性取代原始数量 - 可作为跨论文对比智能体系统时的校准参考

软件开发基准测试

SWE-Bench

资源SWE-Bench

用于测试 AI 系统自动解决真实 GitHub Issue 能力的数据集。智能体须理解代码库、复现缺陷,并实现能通过现有测试套件的修复。SWE-Bench Verified 是经人工验证可解性的精选子集。

核心特性: - 来自主流 Python 仓库的 2,294 个真实 GitHub Issue - 需要理解大型代码库 - 通过自动化测试套件执行进行评估 - 编码智能体评测的行业标准

SWE-bench Pro

SWE-bench 的显著加强版,针对生产级软件工程挑战。任务来源于更复杂的真实场景,需要跨多个文件修改、更深入的代码库理解,以及在比原始基准更大上下文中的推理能力。

核心特性: - 更难的任务选取:与标准 SWE-bench 相比,Issue 需要更多推理步骤、更宽泛的代码库上下文和多文件变更 - 更长的有效上下文需求——智能体须在陌生的大型代码库中导航 - 旨在区分顶尖编码智能体,因为标准 SWE-bench 分数已趋于收敛 - 保持与原版相同的自动化测试套件评测方法 - 适用于构建或选型生产环境软件工程工作流智能体的团队

ALE-Bench

资源ALE-Bench Leaderboard | Paper (NeurIPS 2025) | GitHub

面向长时域、目标驱动算法工程的基准测试,由 Sakana AI 开发,已被 NeurIPS 2025(Datasets & Benchmarks 赛道)收录。题目源自 AtCoder Heuristic Contest(AHC)——聚焦无已知精确解的 NP-hard 优化问题的真实竞技编程赛事。与通过/失败型编码基准不同,ALE-Bench 以向连续数值分数迭代改进为奖励机制,贴合人类选手数天乃至数周打磨算法的过程。

核心特性: - 40 道题目,来源于 2025 年 4 月前举办的 AHC 赛事;另提供 10 道代表性题目的精简子集 - 基于分数的评测(非通过/失败):以连续数值目标衡量解的质量,支持细粒度比较 - 长时域:鼓励多轮迭代改进——智能体提交代码、观察测试运行反馈与可视化结果,并循环优化解决方案 - 领域:路由、规划、多智能体控制、谜题求解、贝叶斯推断及其他 NP-hard 组合优化问题 - 评分指标:单题原始分数、在约 1,000 名人类选手中的排名,以及类 Elo 绩效评分;以全套题目的均值/中位数汇总 - ALE-Agent(Sakana AI 的参考智能体):在真实 AtCoder Heuristic Competition 中取得约 1,000 名参赛者中前 21 名的成绩,验证了基准测试到真实竞赛的可迁移性 - 以与 SWE-bench(缺陷修复、通过/失败)截然不同的评测维度形成互补:在时间预算内进行连续优化,而非二元正确性判断

多智能体与协作基准测试

AgentBench

一个综合性基准测试,评测 LLM 作为智能体在 8 种不同环境中的表现,涵盖操作系统、数据库、知识图谱、数字卡牌游戏、横向思维谜题、家务任务、网页购物和网页浏览。

τ-bench(Tau-bench)

评测智能体在真实客服场景中的表现,要求多轮对话、政策遵从和工具调用能力,考察智能体在有效服务客户的同时遵守复杂业务规则的能力。

智能体记忆基准测试

LongMemEval

资源Paper (ICLR 2025) | GitHub | Website

LongMemEval(Wu et al.,UCLA NLP)是针对对话助手在跨多会话长期记忆方面的基准测试,通过扩展的多会话历史考察长期交互记忆能力。该基准形式化了三阶段记忆架构——索引(Indexing)、检索(Retrieval)、读取(Reading)——并以 500 道精心筛选的问题(配以带时间戳的对话历史)评测五项核心记忆能力。

五项核心记忆能力: - 信息提取:从历史会话中检索特定陈述的事实 - 跨会话推理:综合分散在多轮对话中的信息 - 时序推理:理解并推断事件相对于查询的发生时间 - 知识更新:处理信息随时间变更或被推翻的情况 - 拒答能力:识别记忆中不存在答案的情况(正确拒答)

核心特性: - 500 道问题,横跨 7 个任务类别:single-session-user、single-session-assistant、single-session-preference、temporal-reasoning、knowledge-update、multi-session 及 abstention 变体 - 三个难度变体:LongMemEval_S(约 115k tokens,约 40 个会话)、LongMemEval_M(每段历史约 500 个会话)、LongMemEval_Oracle(Oracle 检索上界) - 受"大海捞针"方法论启发,通过属性控制流水线生成连贯、可扩展的带时间戳对话历史 - 使用 GPT-4o 自动 QA 评测;支持轮次级和会话级记忆召回指标 - 评测系统包括 BM25、Contriever、Stella 和 GTE 嵌入;以及配合关键信息扩展策略(摘要、关键短语提取、用户事实提取)的 RAG - 已被 ICLR 2025 收录

LongMemEval-V2

资源Paper (arXiv 2605.12493, May 2026) | Website

LongMemEval-V2(Wu et al.,UCLA NLP)将基准测试延伸至智能体场景,评估记忆系统是否能帮助网页智能体积累特定环境的经验——目标是培养"知识丰富的协作者",而非精准的对话助手。V2 从对话历史转向专业网页环境中的行动轨迹。

五项智能体记忆能力: - 静态状态回忆:记住环境的固定信息(UI 布局、可用字段、配置) - 动态状态追踪:跟踪环境状态在智能体轨迹中的变化 - 工作流知识:回忆完成重复性任务的多步骤流程 - 环境陷阱:记住已知的失败模式、边界情况和绕过方法 - 前提感知:识别任务前置条件未满足的情况

核心特性: - 451 道人工精选问题 - 每段历史最多 500 条轨迹;总 token 数最高达 115M——上下文规模远大于 V1 - 环境来自 WebArena 和 WorkArena:Magento 购物、购物管理后台、Postmill 论坛、ServiceNow - 针对 V1 聚焦用户偏好回忆所未覆盖的程序性和环境性记忆缺口 - 作者:Di Wu、Zixiang Ji、Asmi Kawatkar、Bryan Kwan、Jia-Chen Gu、Nanyun Peng、Kai-Wei Chang(UCLA NLP)

研究与检索基准测试

DeepResearch Bench

资源Project Page | Paper (arXiv 2506.11763) | GitHub | Dataset | Leaderboard

DeepResearch Bench(DRB)由中国科学技术大学(USTC)研究人员开发,是系统评测深度研究智能体(Deep Research Agents,DRAs)的基准——这类基于 LLM 的智能体能自主编排多步网页探索、精准检索和高层次综合,生成具备分析师水准、引用翔实的研究报告。

核心特性: - 100 道博士级研究任务(50 道中文,50 道英文),横跨 22 个主题领域:科学与技术(物理、化学、生物、环境科学、工程)、金融与商业(投资、个人理财、营销、人力资源)、软件,以及其他领域(艺术与设计、娱乐、历史、工业、交通、旅游) - 领域分布基于对 96,147 条匿名真实用户查询的分析(来自支持网页搜索的 LLM 交互),通过 WebOrganizer 分类体系分类,以反映真实研究需求 - 任务由博士级领域专家和资深从业者(5 年以上经验)撰写并筛选,确保质量、清晰度、真实性和挑战性

评测框架: - RACE(Reference-based Adaptive Criteria-driven Evaluation):从综合性、洞察深度、指令遵从和可读性四个维度,以动态生成的任务专属加权标准对生成报告与参考报告进行评分 - FACT(Framework for Factual Abundance and Citation Trustworthiness):从报告中提取"陈述-URL 对"(事实性声明与引用来源),去重后通过网页抓取和 LLM 判断验证每条来源是否支持其声明,产出引用准确率和每任务有效引用数指标

评测基础设施: - 初始评测器配置(2025 年 7 月):RACE 使用 Gemini-2.5-Pro,FACT 使用 Gemini-2.5-Flash;评测的 DRA 包括 Kimi-Researcher、Doubao-DeepResearch 和 Claude-Researcher,原始文章和分数已发布在 Hugging Face 排行榜 - (更新:截至 2026 年 5 月,官方评测器已切换至 GPT-5.5(RACE)和 GPT-5.4-mini(FACT),原因是 Google 宣布弃用 Gemini-2.5-Pro。相较于人工标注者间一致性基准 68.78%,各候选评测器得分如下——GPT-5.5:71.82%(PAR 73.00,OPC 89.70,FAP 65.35,FAS 59.23);Gemini-3.1-Pro:70.58%;Claude-Opus-4-7:70.11%。2026 年 5 月 31 日前设有双接受窗口,在旧版(Gemini-2.5-Pro)和新版(GPT-5.5)评测器下分别接受提交,并设有独立排行榜;旧版代码保留在 Gemini-2.5 分支)

许可证:基准测试代码采用 MIT 许可证;数据集和排行榜托管于 Hugging Face

相关内容DeepResearch Bench II(DRB II)(2026 年 2 月,论文)是同一实验室发布的后续基准,以 9,430 条细粒度二元评分标准(信息召回、分析、展示)——源自专家撰写的文章——评测 DRA 报告,评测侧重点与 DRB 不同。DRB 与 DRB II 并行独立维护。

WANDR

WANDR(Wide And Nuanced Deep Research)评测智能体在"广度研究"任务上的表现,这类任务需要对搜索、计算和模型推理进行精心编排。其灵感源自 Perplexity Computer 为用户处理的知识密集型专业任务,在 WideSearch 等基准基础上迭代,着重构建更复杂的任务结构和多来源综合需求。

核心特性: - 任务需要多步骤、多来源的研究工作流,而非单次查询检索 - 评估编排质量——智能体须决定使用哪些检索策略、以何种顺序执行,以及如何聚合结果 - 从准确性、引用正确性和结构化输出完整性三个维度评分 - 旨在揭示固定 RAG 流水线与自适应检索策略之间的差距 - Perplexity 的 Search as Code(SaC)架构在 WANDR 上比第二名领先 2.5 倍 - 适用于构建研究智能体、知识综合流水线或竞争情报系统的团队

参考资料Rethinking Search as Code Generation,Perplexity AI Research,2025 年 9 月。

领域专用智能体基准测试

Finance Agent v2

面向复杂金融任务的领域专用基准测试,要求 AI 智能体具备多步推理、工具调用和领域专业知识。第 2 版在原版基础上引入了更难的任务,并扩大了金融领域覆盖范围。

核心特性: - 任务涵盖市场分析、投资组合构建、金融文件解读、财报电话会议分析和监管合规推理 - 需要通过工具调用整合外部数据源(行情数据、SEC 文件、财务报表) - 多步推理链:智能体须串联检索、计算和解读步骤以得出最终答案 - 对照专家标注的标准答案评分,而非自动化测试套件 - 适用于构建金融 AI 助手、交易智能体或合规自动化系统的团队 - 第 2 版相比 v1 新增了更复杂的投资组合优化场景和跨文档推理任务

基准测试选型指南

应用场景 推荐基准测试
通用智能体能力 GAIA
网页自动化 VisualWebArena
计算机使用(广泛) OSWorld
计算机使用(可靠信号) OSWorld-Verified
软件开发(标准) SWE-Bench
软件开发(高难度/生产级) SWE-bench Pro
算法工程 / 优化 ALE-Bench
终端/CLI 任务 Terminal-Bench 2.1
安全评测 METR
客服智能体 τ-bench
金融领域智能体 Finance Agent v2
广度/深度研究编排 WANDR
深度研究报告质量与引用准确性 DeepResearch Bench
长期记忆(对话助手) LongMemEval
长期记忆(网页智能体) LongMemEval-V2

评测注意事项

可复现性

与静态 LLM 基准测试相比,智能体基准测试更难复现,原因包括: - LLM 输出的不确定性 - 随时间变化的动态网页环境 - 对外部 API 和服务的依赖

成本

运行智能体基准测试成本高昂——每个任务可能需要数十次 LLM 调用和工具执行。应合理规划预算,并使用较小的评测子集进行快速迭代。

排行榜污染

随着基准测试公开,训练数据污染成为值得关注的问题。优先选用拥有保留测试集或定期更新任务集的基准测试。

参见