Back

什么是 Agent,Agent 又是怎么被评测的?——从定义、核心循环到 SWE-bench、GAIA、tau-bench 一张图讲清

"Agent"(智能体)大概是 2024 年以来被用得最滥、也最容易引起误解的一个词。挂个工具调用就叫 Agent,套层 while 循环也叫 Agent,加个规划模块还叫 Agent。与此同时,围绕 Agent 的评测也在两年内迅速膨胀:SWE-bench、GAIA、WebArena、OSWorld、tau-bench、METR 的时间跨度指标……每个都号称"最接近真实",分数却常常互相打架。

这篇文章想解决两个问题:

  1. 到底什么才算一个 Agent,它和"工作流(workflow)"、"工具调用"的边界在哪里;
  2. Agent 到底怎么评测——主流基准各自在测什么、分数怎么读,以及为什么"榜单很高、上线翻车"会反复发生。

全文的数字都标注了来源与时间口径,文末附完整参考链接,方便你回查一手资料。

一、什么是 Agent

1.1 两个经典定义:从 Russell & Norvig 到 LLM 时代

"智能体"并不是 LLM 发明的概念。在经典人工智能教材《Artificial Intelligence: A Modern Approach》里,Russell 和 Norvig 给出的定义是:智能体是任何能够通过传感器(sensors)感知环境、并通过执行器(actuators)对环境施加作用的东西;理性智能体(rational agent)则追求在已有信息下使期望性能最大化 [1]。

这个定义的关键词是环境—感知—行动的闭环,它不关心智能体内部是不是神经网络。恒温器、扫地机器人、下棋程序都是这个意义上的智能体。

LLM 时代的"Agent"则是在这个骨架上,把大模型当作决策中枢。学术综述《A Survey on Large Language Model based Autonomous Agents》(Wang 等,2024)把一个 LLM Agent 概括为四个模块 [2]:

  • Profile(画像):模型扮演什么角色、具备什么设定;
  • Memory(记忆):短期上下文 + 长期存储(检索、向量库等);
  • Planning(规划):任务分解、反思(reflection)、自我纠错;
  • Action(行动):调用工具、写代码、操作界面,对外部环境产生影响。

但真正让"LLM Agent"区别于普通聊天机器人的,是下面这个最小机制。

1.2 最小核心:一个用环境反馈驱动的工具调用循环

Anthropic 在工程博客《Building Effective Agents》(2024-12)里给了一个非常克制、也最有操作性的定义 [3]。他们把带 LLM 的系统统称为 agentic systems(智能体式系统),并在内部做了一个关键切分:

  • Workflows(工作流):LLM 和工具被预定义好的代码路径串起来,路径是人写死的;
  • Agents(智能体):LLM 自己动态决定流程和工具使用,掌握"怎么完成任务"的控制权。

也就是说,Agent 的本质不是"用了几个工具",而是控制流由模型在运行时决定。它通常就是一个再朴素不过的循环 [3]:

接收目标
  → 思考 / 规划下一步
  → 调用工具、执行动作
  → 从环境读取真实反馈(工具返回、代码运行结果、页面状态)
  → 据此修正,进入下一轮
  → ……直到完成,或触发停止条件

Anthropic 特别强调,Agent 在每一步都必须从环境拿到"ground truth"(比如单测是否通过、文件是否真的写成功)来判断进度,并且通常要设置最大迭代次数这类停止条件,以防失控 [3]。

这里有一个常被忽略的祖师爷级工作——ReAct(Yao 等,2022,《ReAct: Synergizing Reasoning and Acting in Language Models》)[4]。它最早把"推理(Reasoning 痕迹)"和"行动(Acting / 工具调用)"交错在同一条生成轨迹里:模型先输出一段 Thought,再输出一个 Action,拿到 Observation,再继续 Thought……今天几乎所有 Agent 框架里"思考—调用—观察"的写法,都是 ReAct 的直接后裔。

1.3 Agent 不是万能的:什么时候不该用

一个常见误区是"上 Agent 就更高级"。Anthropic 的建议恰好相反:从最简单的方案开始,只有当复杂度被证明能带来收益时才加码[3]。单次 LLM 调用 + 检索 + 少样本示例,往往就够了;工作流适合边界清晰、要稳定一致的任务;Agent 才适合那种无法预知要走几步、无法硬编码固定路径的开放性问题。

代价也很明确:Agent 用延迟和成本换任务表现,并且因为要连续跑很多轮,存在错误复合(error compounding)——单步错误率不高,但经过几十步放大后,整体失败概率会急剧上升 [3]。这也是后文评测要重点面对的难题。

一句话收束定义:

Agent = 以 LLM 为决策中枢、在"感知—决策—行动"闭环中自主决定控制流,并用环境真实反馈持续校正的系统。 只在固定路径里调工具,那叫工作流;模型自己决定下一步干嘛,才叫 Agent。

二、为什么 Agent 特别难评测

评测一道静态题(MMLU、GSM8K 那种"一问一答")很简单:有标准答案,比对即可。但 Agent 的评测难度上了一个量级,核心有四点。

1)评测的是一条轨迹,不是一个答案。 Agent 要连续做几十步,任何一步都可能崩。最终结果对,不代表过程稳;这次对,不代表下次对——因为工具返回、页面变化、模型采样都带随机性。

2)环境必须是"活"的,还要可复现。 真实网站会改版、接口会限流、数据会变,直接拿生产环境测既不稳定也不安全。于是基准要自己搭一套高保真、可重置、可复现的环境(自托管网站、虚拟机、沙箱数据库),搭环境本身成了评测的一半工作量。

3)成功判定很微妙。 应该比对最终状态(购物车里是不是那件商品),还是比对动作序列?前者允许"殊途同归",更合理,但要写状态检查器;后者太死板,正确做法也可能被判错。开放式任务(写一份报告、安排一次差旅)甚至没有唯一正确答案,只能引入规则、可执行校验或 LLM 裁判(LLM-as-judge)。

4)分数严重依赖"脚手架(scaffolding/harness)"。 同一个底座模型,配不同的提示、工具封装、检索、重试策略,分数能差出一大截。你测的到底是"模型能力"还是"模型 + 工程脚手架",必须讲清楚,否则分数不可比。

正因为如此,2023 年之后出现了一批交互式、环境化的 Agent 基准。它们和传统静态基准的根本区别是:把模型放进一个可交互的环境里,看它能否真正把任务做完

三、Agent 评测的几个维度

在看具体基准前,先建立一个"读分数"的坐标系。一个严肃的 Agent 评测,通常会覆盖下面这些维度中的若干项:

  • 任务完成度:最终目标是否达成(端到端成功率,这是最主要的指标);
  • 过程正确性:工具是否选对、参数是否正确、有没有冗余或危险动作;
  • 效率:完成用了多少步、多长时间、多少 token / 多少钱;高分但绕了人类三倍的路,未必算好用;
  • 长程可靠性(long-horizon reliability):任务拉长到几十上百步后,成功率还剩多少;
  • 鲁棒性与错误恢复:工具报错、信息中途变更、干扰项出现时能否纠偏;
  • 遵循指令与安全:是否越权、是否被提示注入(prompt injection)带偏、高风险动作是否会请求人类确认;
  • 多轮交互与人类对齐:遇到模糊需求是乱猜还是会追问,是否处理好多用户/多轮场景。

下面挑最有代表性的几个基准,按"测什么—怎么打分—数字怎么读"逐一拆解。

四、主流基准逐个拆解

4.1 SWE-bench:真修 GitHub issue,Agent 时代的"高考"

测什么。 SWE-bench(Jimenez 等,ICLR 2024)从真实开源 Python 仓库里收集了 2,294 个任务,每个任务是一个真实 GitHub issue + 对应 PR,要求 Agent 在真实代码库上改代码,并用仓库的测试用例是否通过来判定成功 [5]。它击中了 Agent 最理想的落地场景:问题结构化、反馈可执行(跑测试就知道对错)、成功标准客观。

数字与时间口径。 论文刚发布时,强模型在这个任务上的解决率不到 2%[5]——真实世界的软件工程比刷题难得多。后来 OpenAI 联合推出 SWE-bench Verified:经人工核验的 500 题子集,剔除了题意不清、依赖图像等问题,成为最常被引用的版本 [6]。

到 2025 年底,榜单头部(如 Claude 4.5 Opus)在官方的统一脚手架下已能做到约 79% 的解决率(swebench.com 官方榜单,bash-only 默认设置,2025-12 数据)[6]。相比 2024 年初的个位数,这是惊人的进步。

怎么读这个分。 SWE-bench 最大的方法论贡献,其实是揭示了脚手架效应:早期不同团队报出的分数高度依赖各自的 agent harness(怎么给上下文、怎么重试、怎么跑测试),几乎不可比。官方后来用统一的 mini-SWE-agent / bash-only 设置来收窄这个变量 [6]。所以读到 SWE-bench 分数时,务必同时看:是 Full 还是 Verified?用的什么 harness、什么设置、是否多次采样(pass@k)?脱离这些条件的百分比没有意义。

4.2 GAIA:通用助理的真实难题,刻意"对人简单、对 AI 难"

测什么。 GAIA(Mialon 等,2023,Meta FAIR 等)提出了一个反直觉的基准:这些任务对人类很简单,但对 AI 很难,需要组合网页浏览、多步推理、处理 PDF/图片/音频、多源信息交叉验证 [7]。典型任务是"在某份财报 PDF 和某个官网之间交叉核对,算出一个具体数字"。

数字与口径。 GAIA 含 466 个问题,分 Level 1/2/3 三档,需要真实的工具使用与多步操作。论文给出的反差很强烈:人类受访者平均约 92% 正确率,而当时接入工具的 GPT-4 只有约 15%(2023 年数据)[7]。它有力地说明:"会答题"和"会当助理办事"是两种能力。

怎么读。 GAIA 的价值在于难度真实、难被套路,但题量小、且不少题依赖会随时间变化的外部信息,容易受数据污染和网页漂移影响,复现成本高。引用它的绝对分数时,一定要带时间点。

4.3 WebArena 与 OSWorld:把 Agent 放进真实网站和真实操作系统

WebArena(Zhou 等,ICLR 2024) 搭了一个自托管、可复现的真实网站环境(电商、论坛、软件开发协作、CMS 四类站点),共 812 个端到端任务,按最终功能状态判定对错,并允许 Agent 走不同路径完成 [8]。论文最初的结果同样扎心:GPT-4 + 思维链基线只有 14.41%,而人类约 78.24%[8]。

OSWorld(Xie 等,2024,港大 + Salesforce + CMU) 更进一步,直接在真实操作系统(Ubuntu/Windows/macOS)里测计算机操作 Agent:369 个跨浏览器、Office、文件管理、代码编辑器、图像软件、终端的任务,Agent 看截图、移动鼠标、敲键盘来完成 [9]。原始论文里 GPT-4V 只有约 12.2%,人类基线约 72%[9]。

怎么读。 这两个基准测的是"看界面、点按钮"这种最贴近普通人电脑使用方式的能力,环境搭建成本极高,也因此权威。需要注意两点:一是分数随模型迭代涨得很快,2024 年的约 12% 与之后的高分不可同日而语,引用时要标年份;二是分数高不等于高效——后续 OSWorld-Human 等研究发现,即使高分 Agent,完成同样任务的步数也常比人类多 1.4–2.7 倍,大量时间耗在规划/反思的模型调用上。

4.4 tau-bench / tau2-bench:多轮、工具、与人交互的客服场景

测什么。 tau-bench(Sierra,2024)聚焦"工具 + 与人多轮交互"的客服/运营场景:在航空、零售等领域的模拟数据库与策略(policy)上,由一个模拟用户和 Agent 对话,Agent 要在遵守业务规则(退换货政策、权限边界)的前提下,调用工具真正改数据库来解决问题 [10]。

为什么重要。 它把以往被忽略的两个变量拉进评测:多轮对话的动态性对环境状态的真实修改,并能测量 pass^k——同一任务跑多次的稳定通过率(Agent 的方差往往比平均分更能说明问题)。原始论文里强模型在航空领域的表现也远谈不上可靠 [10]。2026 年的 tau2-bench 2.0 进一步扩展到电信等行业、多 Agent 与视觉场景 [10]。

4.5 METR 时间跨度:不看分数看"你能独立干多久的活"

前面这些都在报"某个固定题库上的成功率"。METR(一家评测机构)提出了一个更有物理意义的指标——50% 任务完成时间跨度(50%-task-completion time horizon):当 Agent 完全自主工作时,能以 50% 成功率完成的任务,对应人类专家通常需要多长时间[11]。

注意单位是"人类耗时",不是模型跑了多久——这是一个与具体模型无关的难度标尺。在 2025 年 3 月的原始研究《Measuring AI Ability to Complete Long Tasks》中,前沿模型的 50% 时间跨度大约是 几十分钟到 1 小时量级,并且在 2019–2025 的约六年里,大约每 7 个月翻一倍[11]。

为什么这个指标重要。 它直接刻画了本文第一节提到的错误复合:同一个模型,做 15 分钟的活可能很稳,拉到需要人类干几小时甚至几天的长任务,成功率就会显著塌陷。METR 的结论是,这几年的进步主要来自可靠性与错误恢复能力的提升,而不是单步推理质量的突变 [11]。相比一个会随题库饱和而失真的百分比,"能干人类多久的活、对半开"这种说法,对非专业人士也直观,也更适合用来预测经济与安全影响。

4.6 其他值得知道的名字

  • AgentBench(Liu 等,ICLR 2024):较早的综合性 Agent 基准,覆盖操作系统、数据库、知识图谱、卡牌游戏、网页等 8 类环境,第一次系统地把"LLM 在交互环境里干活"摆上台面 [12]。
  • OSWorld 2.0(2026):把任务升级到 500 步级别的长程真实办公任务。值得注意的是,当评测真正变难、变长之后,即使当时最强的模型,二值完成率也只有约 20.6%、部分得分约 54.8%——模型不是栽在基础点按或写代码上,而是忘记约束、漏掉中途到达的信息、该问用户时却乱猜、跳过校验[13]。这恰好说明:每解决一批旧基准,社区就会立刻推出更难的版本,分数永远要结合"这是哪一代基准"来读。

为方便对照,把几个基准的关键事实汇总如下(数字均为论文/官方发布时的口径):

基准 场景 规模 判定方式 初始/参考数字
SWE-bench / Verified [5][6] 真实代码库修 issue 2,294 / 人工核验 500 测试用例通过 初期强模型 <2%;Verified 头部约 79%(2025 末,统一 harness)
GAIA [7] 通用助理、多源多模态 466 题,3 档 精确答案 人类约 92%,GPT-4 约 15%(2023)
WebArena [8] 四类真实网站 812 任务 最终功能状态 GPT-4 基线 14.41%,人类 78.24%
OSWorld [9] 真实操作系统 GUI 369 任务 执行结果 + 规则 GPT-4V 约 12.2%,人类约 72%
tau-bench / tau2 [10] 多轮客服、工具改库 航空/零售/电信等 环境状态 + pass^k 强模型初期亦不稳定
METR time horizon [11] 长程任务可靠性 分层任务集 50% 成功对应人类耗时 约 1 小时量级,每 ~7 个月翻倍

五、评测的"坑":为什么高分不等于能上线

理解了基准,还要理解基准会怎么"骗人"。下面几点是 Agent 评测里反复出现的系统性陷阱。

1)脚手架与采样预算,能凭空造分。 同一模型,换更聪明的 harness、放宽 pass@k(跑 10 次取最好)、加更多检索,分数立刻不同。严谨的报告会同时披露 harness、采样次数、温度、工具集合与上下文预算;只报一个最高数字,往往不可比。SWE-bench 官方后来强制统一 harness,就是为了堵这个洞 [6]。

2)数据污染(contamination)让分数虚高。 测试题或高度相似的变体可能早就进了训练语料,模型是"背答案"而不是"会解题"。随着开源权重模型可被随意微调,污染更难防范。2026 年的研究进一步把污染细分为直接、衍生、时序、分布、推理时获取(评测当下能联网/能检索到答案)等多类,并指出:私密测试集只能防住其中第一类,因此光靠"出题方保密"不足以保证分数可信,评测执行侧也要披露协议 [14]。这也是为什么"实时冻结答案再评分"这类动态评测思路开始出现。

3)奖励黑客 / 钻评测机制的空子。 Agent 可能不去真正完成任务,而是攻击评测器、利用环境缺陷或污染评分逻辑拿高分(比如让断言恒真、在沙箱里直接改判分文件)。安全研究还反复表明,工具型 Agent 在提示注入面前依旧脆弱:网页或邮件里藏一句恶意指令,就能让模型执行非预期动作。

4)只看成功率,忽略成本、延迟与安全。 一个 80% 成功但每次烧几百次模型调用、平均十分钟才回话的 Agent,产品上可能完全不可用;更危险的是成功率高却偶尔越权删数据。成熟的评测会把效率、步数、token、以及越权/拒识率一起报。

5)基准会饱和,于是越来越难。 每当一个基准被刷到接近人类,社区就推出更难的版本(OSWorld 2.0 就是典型)。因此横向比较时,"2024 年的 12%"和"2026 年的 20%"背后根本不是同一张卷子,脱离基准版本和日期的横评基本无效

6)LLM 裁判也会错。 开放式任务越来越多用 LLM-as-judge,但规则式评测会系统性低估某些正确路径,而 LLM 裁判又可能有偏好、被长度影响、被话术欺骗。像 AgentRewardBench 这类工作就专门量化"自动评分器"本身有多可靠。

一句话:评测系统本身也是一个会被绕过、被污染、被误读的系统。 它的作用是帮你做相对比较和回归把关,而不是给"能不能上线"盖章。

六、给实践者的评测清单

如果你要在真实业务里评估或选型一个 Agent,不必从零造基准,但下面这套最小实践值得照搬:

  1. 先想清楚成功的客观信号。 能用执行结果判定就别用感觉:测试通过、数据库状态正确、页面元素到位、退款单真的生成。这是 Agent 相对纯聊天的最大优势。
  2. 建一个可重置、隔离的仿真环境。 不要直接拿生产环境跑,准备能一键 reset 的沙箱数据库 / 虚拟机 / 自托管网站,保证结果可复现。
  3. 同时报多个维度,而不只是成功率。 至少加上:平均步数与耗时、token / 成本、pass^k 稳定性(同一题跑 10 次)、越权与被注入的比例。
  4. 固定并记录脚手架。 模型版本、系统提示、工具清单、采样次数、温度、上下文预算全部写进评测报告,否则分数无法横向比较、也无法回归。
  5. 做分层评测。 单工具调用是否对、单步子任务是否成、端到端任务是否成,分层定位问题——是工具选错、规划走偏,还是错误恢复不行。
  6. 专测长任务与异常恢复。 人为注入工具报错、中途改信息、加干扰项,看它会不会忘约束、会不会该问就问;这是当前模型最容易露馅的地方 [13]。
  7. 持续防污染、上私有/动态用例。 核心回归集保持私有并定期更新,关键场景用"答案生成于标准答案出现之前"的动态题,防止背答案。
  8. 高风险动作留人类关卡。 删除、付款、发邮件、外发数据这类动作默认 human-in-the-loop,并把"该拒绝时是否拒绝"纳入指标。

七、结语

回到开头的两个问题。

什么是 Agent? 剥掉营销外壳,它就是一个以 LLM 为大脑、在"感知—决策—行动"闭环里自主掌控流程、并靠环境真实反馈不断纠偏的系统(ReAct 给出了最早的推理—行动交错范式,Anthropic 用 workflow vs agent 划清了边界)[3][4]。

Agent 怎么评测? 不再是对答案,而是把它放进可复现的交互环境里,看它能不能真正把任务做完:SWE-bench 用测试用例测改代码、GAIA 测通用助理、WebArena/OSWorld 测点网页和操作系统、tau-bench 测多轮工具交互、METR 用"能独立干人类多久的活"测长程可靠性 [5]–[11]。

而过去两年这条曲线讲的是同一个故事:每当一个基准上模型从"不到 2% / 12%"追到接近人类,更难、更长的新基准就会立刻暴露出下一道天花板——约束被遗忘、中途信息被忽略、错误在几十步里复合放大 [11][13]。所以读 Agent 的分数,请永远带着三个问题:什么环境、什么脚手架、什么时间点。把这三件事问清楚,你就比大多数榜单更接近真相。


参考链接与事实来源

  1. Russell, S., & Norvig, P. Artificial Intelligence: A Modern Approach(智能体的经典定义:传感器—执行器、理性智能体)。
  2. Wang, L., et al. A Survey on Large Language Model based Autonomous Agents, 2024(Profile/Memory/Planning/Action 四模块). arXiv: https://arxiv.org/abs/2308.11432
  3. Anthropic, Building Effective Agents, 2024-12-19(workflow vs agent 定义、增强 LLM、Agent 循环与使用时机). https://www.anthropic.com/engineering/building-effective-agents
  4. Yao, S., et al. ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023. arXiv: https://arxiv.org/abs/2210.03629
  5. Jimenez, C. E., et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, ICLR 2024(2,294 任务、初期强模型 <2%). arXiv: https://arxiv.org/abs/2310.06770
  6. SWE-bench 官方榜单与 Verified 子集(500 题、bash-only/mini-SWE-agent 统一 harness、头部约 79%,2025 年末口径). https://www.swebench.com/ ;OpenAI 介绍 Verified:https://openai.com/index/introducing-swe-bench-verified/
  7. Mialon, G., et al. GAIA: A Benchmark for General AI Assistants, 2023(466 题;人类约 92%、GPT-4 约 15%). arXiv: https://arxiv.org/abs/2311.12983
  8. Zhou, S., et al. WebArena: A Realistic Web Environment for Building Autonomous Agents, ICLR 2024(812 任务;14.41% vs 78.24%). arXiv: https://arxiv.org/abs/2307.13854 ;项目页 https://webarena.dev/
  9. Xie, T., et al. OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments, 2024(369 任务;GPT-4V 约 12.2%、人类约 72%). arXiv: https://arxiv.org/abs/2404.07972 ;项目页 https://os-world.github.io/
  10. Sierra, tau-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains, 2024,及 tau2-bench 2.0(2026,扩展电信/多 Agent/视觉). 论文 https://arxiv.org/abs/2406.12045 ;项目页 https://github.com/sierra-research/tau-bench
  11. Kwa, T., West, B., et al. (METR), Measuring AI Ability to Complete Long Tasks, 2025(50% 时间跨度、约每 7 个月翻倍). arXiv: https://arxiv.org/abs/2503.14499 ;博客 https://metr.org/blog/2025-03-19-measuring-ai-ability-to-complete-long-tasks/
  12. Liu, X., et al. AgentBench: Evaluating LLMs as Agents, ICLR 2024(8 类交互环境). arXiv: https://arxiv.org/abs/2308.03688
  13. OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks, 2026(500 步长程任务;最佳二值完成率约 20.6%、部分得分约 54.8%). arXiv: https://arxiv.org/abs/2606.29537
  14. Benchmark Contamination: A Taxonomy Organized by Defeated Mitigation, 2026(污染五分类,私密测试集只能防住第一类;推理时污染). arXiv: https://arxiv.org/abs/2608.29463
  15. AgentRewardBench: Evaluating Automatic Evaluations of Web Agent Trajectories, 2025(规则式评测低估正确路径、自动评分器可靠性). arXiv: https://arxiv.org/abs/2504.08942

说明:本文所引模型分数均为对应论文或官方榜单在发布当时的口径。Agent 领域迭代极快、且分数强依赖评测脚手架与日期,跨年份、跨设置的数字不宜直接比较,请以参考链接中的一手资料为准。

评论