Agent 评测可靠性:堆任务救不了排行榜

发布于 2026年10月3日 作者 Remy

排行榜上的数字看起来很干净:模型 A 比 B 高 3 个点,系统卡里写「领先」,政策讨论里也能引用同一张表。问题是——这个分数到底在支持什么结论?是「部署这套完整系统更稳」,还是「底层模型更强」,还是「绝对分可以当能力门槛」?三类主张经常挤在同一个榜上,却对应不同的测量目标。分数本身不会自动告诉你它在替哪一类主张背书。

斯坦福与 UIUC 的 Michael Hardy、Ruhana Azam、Anka Reuel、Mykel Kochenderfer、Sanmi Koyejo 在 arXiv:2610.00651(Agent Evaluation Reliability: More Tasks Won’t (Always) Fix An Agent Leaderboard,预印本 2026-09-30)把这层含糊拆开:可靠性是主张依赖的——能可靠地给已部署系统排序,未必能可靠地给底层模型排序,更未必给出可靠的绝对分。他们问的不是「这个 agent 跑两次稳不稳」,而是:当前 agent 评测究竟可靠地支持哪些结论,再补评测时到底该补什么才会真的帮到结论。[1]

方法上,他们用概括化理论(Generalizability theory,G-theory)搭贝叶斯方差分解,专门对付 agent 排行榜常见的稀疏、不平衡设计,并落到 Holistic Agent Leaderboard(HAL)与 Harbor Index 共 22 个基准(HAL 9 个 + Harbor 13 个)。四条可落地结论值得先记:固定 模型–scaffold(外围编排;文中与 harness、甚至「agent」常混用)系统排序可靠,Eρ² = 0.935–0.994;底层模型排序可靠度明显更低,0.148–0.841;即便无限堆「同类构造」任务,在 scaffold 覆盖不足主导不确定时,模型排序可靠度最多也就再抬约 0.097;把多样基准池化,同样任务预算下投影可靠度可从约 0.44 到 0.75,投影成本最高可降约 83%。[1]

站内已经从几条线碰过「评测到底在评什么」:CIR 把 harness 恢复当成因果决策,拆 rescue / harm;SAGE 谈自进化技能的统计验收门;Bad Genius 谈反事实信号怎么进化 harness;轻量对照 MoMHa 谈准确率 / 安全 / token 三目标。这篇补的是更上游的一问:排行榜数字在支持哪一类主张,以及预算该花在哪一类不确定性上——而不是默认「任务再多一点就更可信」。[2]

主张依赖:系统排序 ≠ 模型排序 ≠ 绝对分

Agent 评测里,模型很少独自出分。Scaffold 负责管状态、暴露工具、把模型输出落成动作;模型和 scaffold 合在一起才是部署意义上的系统。文中「model」还带上推理力度配置——例如 gpt-5-high 与 gpt-5-minimal 被当成不同对象,以贴近主数据集的做法。于是一开始就有测量选择:你要评「最终上线的那一套」,还是要隔离「可归因于底层模型」的差异?答案一变,什么算信号、什么算误差就跟着变。[1]

可靠性还取决于你想下的结论。实践者可能关心:模型排名会不会在换条件后仍稳?绝对分会不会差不多?表现能不能跨不同 agent 任务泛化?这些是不同的测量目标,不必共享同一份可靠度。既有工作多半研究固定 agent 在重复跑、prompt 扰动、工具配置或环境失败下是否一致——那是系统稳健性。Hardy 等人研究的是比较推断的可靠性:模型或系统的报告排序,在新任务、新 scaffold、新基准下是否还站得住。区分很要紧:一个系统可以在某一个 harness 里跑得很稳,同时它的名次高度依赖那个 harness。[1]

用他们的记号,相对概括化系数是

[ E\rho^2_o=\frac{\sigma_o^2}{\sigma_o^2+\sigma_\delta^2},\qquad \mathrm{SNR}o=\frac{\sigma_o^2}{\sigma\delta^2}=\frac{E\rho^2_o}{1-E\rho^2_o}. ]

分子 (\sigma_o^2) 是对主张有意义、期望在指定泛化全域里持久的差异;(\sigma_\delta^2) 收进会改相对名次、但对主张无关的噪声。信号压过噪声,可靠度就高;在常见分解下,它也可理解为观测分与「全域真分」相关的平方。对象 (o) 若是「模型–scaffold 配对」,scaffold 差异与兼容性可以算信号;对象若是「底层模型」,同一批差异就要进误差——因为换一套 scaffold 后名次不该跟着飘,才谈得上「模型本身更强」。脚注与附录还提醒:即便排名可靠,观察尺度上的分数可靠度往往更低;排名稳,不等于绝对分也能当门槛用。需要数值门槛时,应另看绝对可靠度(dependability,Φ),而不是把排名用的 (E\rho^2) 直接当分数证书。[1]

这一节的实操含义很直:读 HAL 一类多 scaffold、多基准的榜时,先问「这张表声称在排什么」。若答辩 / 系统卡把「某模型领先」写成「某模型+某 harness 领先」,主张其实已经换了;反过来,只报告一个笼统「可靠度」,却不声明对象与泛化全域,读者会把三种主张叠在同一数字上。评测设计若从「我们要证明模型更强」写成「我们在某套脚手架上分数更高」,后半句往往才是数据真正支持的东西。[1]

G-theory 直觉:信号、噪声与几个因子

G-theory 把评测条件当成测量的侧面(facet),把分数变异拆成主效应与交互:模型、任务、scaffold、基准,以及它们的交互。换成人话:框架先分清信号——在你声称要泛化过去的那些条件里仍站得住的表现差;再分清噪声——对主张无关、却仍能改分改名次的变异。可靠度上升,意味着信号相对这类噪声占了上风。关键第一步是选定测量对象:模型–scaffold 兼容性,在选可部署系统时是信号,在独立于脚手架给模型排序时是误差。可靠度因此属于「对象 + 泛化全域 + 评测设计」,不属于「某一个基准」本身。[1]

他们用贝叶斯 Bernoulli–logit 混合模型直接拟合任务级 0/1 成败,避免地板 / 天花板效应下高斯近似骗人;方差分量与可靠度系数定义在共同的潜在 log-odds 尺度上。基准级分解大致区分:持久的模型差、任务敏感、scaffold 差、模型–scaffold 兼容(交互)。对相对排序,所有模型一起抬高或压低的 scaffold 主效应不会改名次,因此不进误差分母;模型×scaffold 交互会——它编码「谁更吃哪套编排」。这就是为何「系统排序」和「模型排序」可以差很远:前者把兼容性当信号,后者要求差在跨 scaffold 平均之后仍在。同一 ((任务, 模型, scaffold)) 格子很少重复观测时,任务–模型–scaffold 交互无法与潜在残差分开,终端残差用 logistic 残差方差 (\pi^2/3) 承接——这是稀疏设计下的可识别性代价,不是可以忽略的脚注。[1]

为测「换 scaffold 会不会改模型名次」,他们另定义 inter-scaffold reliability(跨 scaffold 可靠度):同一批模型、同一批任务上,两套独立采样的 scaffold 是否给出相近排序——类比跨评分者一致度,只是「评分者」换成了编排系统。低值意味着:模型和任务都固定,只换 scaffold,谁看起来最强仍可能大变。[1]

跨基准联合模型则把「基准条件化能力」与「期望跨基准、任务、scaffold 仍持久的模型分量」分开。命题很干:固定其他侧面样本量,任务数 (n_i\to\infty) 时,任务索引的误差项趋于 0,但基准索引与 scaffold 索引的项仍在。所以任意多的同类任务,也压不掉模型–基准异质性或模型–scaffold 耦合。推论则说:在固定总任务预算 (N=n_b n_i) 下,把预算摊到更多基准,只要基准条件化差异非零,就能提高可靠度——广度减的是条件特异优势的污染,不是「造出」更多持久模型信号。推论也有边界:它假设基准抽取信息量相近、交叉足够、没有额外基准搭建成本;它不声称任意新基准一定优于加任务,也不声称基准永远比 scaffold 更值钱。[1]

数据侧:HAL 九个基准覆盖网页导航、科研编程、多步助手、软件工程、客服对话、竞赛编程等(AssistantBench、CORE-Bench Hard、GAIA、Online-Mind2Web、SciCode、ScienceAgentBench、SWE-bench Verified Mini、τ-bench Airline、USACO);文中写 HAL 约 29,923 次 rollout、54 个模型、13 套 scaffold,其中 9 个模型出现在每个基准上。外加 Harbor Index 作汇合与外部效度对照。观测图在每一层都不完整——这是排行榜常态:评测贵,许多模型–scaffold–基准组合根本缺失。共享模型与 scaffold 把图连起来,才允许部分分离效应;稀疏本身不是小瑕疵,而是方法必须正面处理的设计现实。贝叶斯正则与部分汇合能稳住稀疏格上的估计并传播不确定,但不能给断开的分量凭空制造经验可识别性。[1]

四条结果:数字怎么读

1. 可靠度跟测量目标走

九个 HAL 基准上,系统(模型–scaffold 配对)排序可靠度 Eρ²MA ∈ [0.935, 0.994];模型排序可靠度 Eρ²M ∈ [0.148, 0.841]。这不是对「同一分数」的两套矛盾读法:系统可靠度把 scaffold 差与兼容当信号;模型可靠度要求差在跨 scaffold 平均后仍在。一张榜可以对「上线组合」排序很稳,同时对「单比底层模型」很不稳。引言里区间写法略圆成 (E\rho^2_{MA}\in[0.94,0.99]),正文与摘要以 0.935–0.994 为准。[1]

建议很短:先写清对象是模型还是模型–scaffold 系统,解释是排名还是绝对分;再为该主张估可靠度,而不是丢一个笼统统计量。多 agent 基准共用一张榜时,这一点尤其容易被「总分」叙事冲掉。[1]

2. 换 scaffold,结论可以跟着换

跨 scaffold 可靠度(带 95% HDI)从 OnlineMind2Web 的 0.151 [0.004, 0.577] 到 CORE-Bench Hard 的 0.852 [0.631, 0.947];各基准后验中位数大致落在 0.151–0.852。低端意味着:只换 scaffold,谁像「最强」可以大改,即便模型与任务不变。池化分解还显示:模型主效应与 scaffold 主效应的对比并不一边倒(方向后验概率约 50%);但 scaffold 在任务级上的特异变异,往往大于模型在任务级上的特异变异(文中后验概率约 84% 支持 (\sigma^2_{IA[B]}>\sigma^2_{IM[B]}))——scaffold 可以改「哪些任务被解开」,却不必让某一套 scaffold 在整张基准上全面更强。对工程团队,这对应一个熟悉场景:换工具层或提示编排后,失败集换了一大片,总分却差不多。[1]

若目标是评底层模型:同一模型要跨多套 scaffold 测,并报告结论对 scaffold 有多敏感,别把 scaffold 特异优势记到模型头上。若目标就是部署的那套系统:scaffold 变异可以算被测对象的一部分——此时「换 harness 名次变了」不一定是评测失败,而可能是对象定义下的真实差异。[1]

3. 堆同类任务,盖不住所有不确定

任务增多,只在「主要不确定来自跨任务差异」时帮得上忙;它修不好 scaffold 覆盖不足这类侧面带来的不确定。文中:在观测到的 scaffold 覆盖下,即便无限多同类构造任务,模型排序可靠度最多再抬约 0.10;摘要把同一上界写成 0.097——后文以摘要 0.097 为准,正文「约 0.10」视为同一结果的圆整。只有 CORE-Bench Hard 与 SciCode 能单靠扩任务冲过 Eρ² = 0.75;OnlineMind2Web 则是天花板样例:约 0.148 → 0.153,任务再多也几乎不动。[1]

一句话:基准可以在「任务还没耗尽」之前,先耗尽对主张有用的信息。继续加任务,往往只是把现有评测装置测得更精,而不是让更宽的「模型主张」可靠很多。低可靠度也不等于基准测的能力不重要——它只说明:对当下这批被比的模型,分数分不清你关心的那个量。竞争者群体一变,可靠度还得重估。扩基准前,先估「只加任务」的可靠度天花板,再决定要不要把预算砸进同一构造流程。[1]

4. 池化多样基准:同样预算,更高投影可靠度

若主张是「跨多种 agent 任务给模型排序」,把测试不同任务类型的基准池化,能提供更多「哪些差异在跨设定下仍在」的信息。固定任务预算时,基准广度会平均掉「单基准内复制」动不了的条件特异模型优势。同样任务预算下,把评测摊到九基准电池,投影模型排序可靠度从单基准约 0.44 提到约 0.75。Harbor Index 的汇合分析给出同一方向的定性图景。成本上:完整 HAL 电池超过约 $47,000;均衡分配达到可比可靠度大约 $19,000;若示意目标取 SNR ≈ 2.5(对应 Eρ² ≈ 0.71),约每基准 14 个任务、约 $8,144,投影成本降幅约 83%。附录用任务子采样核对了收益递减,并检验缩减设计是否仍保留 D-study 预测的排序信息。[1]

可靠性调整后的潜在模型效应,与四个留出 agent 基准(BFCL v4、Terminal-Bench 2.0、SWE-bench Verified、τ²-bench Core)的 Kendall’s τ 均值约 0.789,高于简单基准均分的约 0.463——这是汇合预测效度的旁证,不是「存在一维万能 agent 能力」的证明。广度最有用时,设计要连通、基准要有信息量;文中 CORE-Bench Hard(尤其自带 CORE Agent scaffold)SNR 最高,去掉它比去掉其他基准更抬高池化不确定——强信号基准可以通过足够连通,给公共尺度锚点。不平衡设计里,优先找到能桥接条件的信息锚,往往比继续往稀疏边上挂几个模型更有用。[1]

读这四条时,有一个容易混淆的点:系统可靠度高,并不自动证明「模型主张」也快好了。它常常只说明——在当前这套任务与 scaffold 采样下,固定组合的名次够稳。若你真正要对外说的是「换一套合理 harness 之后模型仍然领先」,那就要看模型可靠度、跨 scaffold 可靠度,以及任务-only 天花板还剩多少空间。反过来,若采购 / 上线决策的对象就是某一固定组合,0.93+ 的系统 (E ho^2) 可能已经够用,再砸预算去「纯净模型排序」反而答非所问。主张写清楚,后面的花钱方式才会跟着变。[1]

另一条常见误读是把「再加 100 个同类任务」当成万能药。命题与 OnlineMind2Web 样例合在一起,意思其实很具体:当不确定已被 scaffold(或基准)侧面主导时,同类任务再多,也只是把同一套条件测得更响,不会把缺失的侧面覆盖补回来。工程排期上,这对应「基准扩充」与「编排覆盖 / 基准广度」两本不同的账;混成一本账,最容易出现「任务数很好看、主张可靠度几乎不动」的报表。[1]

做评测 / 读榜时的清单

把论文建议收成可勾的几步:

  1. 先写主张。 对象是底层模型、固定模型–scaffold 系统,还是跨多样 agent 任务的模型排序?要的是相对名次,还是绝对分 / 能力门槛?主张没写清,可靠度数字没有归属;写进系统卡或论文方法段时,尽量用对象语言而不是「总分」语言。[1]
  2. 诊断限制方差。 用(或要求报告)方差分解:当前不确定主要来自任务采样、scaffold 覆盖、基准条件化,还是模型×条件交互?D-study(决策研究)就是在采更多数据前,投影「加哪一类样本最值钱」,并把方差估计的不确定一起带走,而不是只插一个点估计。[1]
  3. 别默认加任务。 任务采样是主瓶颈再加任务;若天花板已被 scaffold / 基准侧面卡住(OnlineMind2Web 那种 0.148→0.153),预算应转向更宽的 scaffold 覆盖或基准广度。扩任务前先算任务-only 渐近可靠度,避免「看起来很努力、对主张几乎无增益」。[1]
  4. 读多 scaffold 榜时拆开报。 系统排序与模型排序分列;需要时报告跨 scaffold 可靠度与「结论对 scaffold 有多敏感」。部署对象是系统时,把 scaffold 算进对象;比模型时,单 scaffold 优势不要写成模型胜利。[1]
  5. 跨任务主张优先池化,而不是每个基准榨干。 在连通与信息量足够的前提下,同样任务预算摊到多样基准,往往比单基准堆任务更贴「跨设定仍持久」的主张;用可靠度分析决定每个基准内还要多少任务,并保留够用的任务多样性。完整电池很贵时,可靠性感知的配额(例如示意的每基准约 14 任务)可能以远低成本逼近目标 SNR。[1]
  6. 绝对分另算。 排名可靠 ≠ 分数可靠。若决策依赖数值门槛,需要单独的绝对可靠度分析;附录强调绝对可靠度不高于对应的排名可靠度,且在多个基准上明显更低。[1]

稀疏榜上仍脆的主张

方法正面承认:排行榜稀疏、不平衡、只部分交叉是常态。贝叶斯正则与部分汇合能稳住方差估计、传播不确定,但不能凭空给断开的分量制造经验可识别性;连通与可估性诊断必须看。单基准内 scaffold 往往太少,scaffold 相关分量要靠跨基准共享与汇合来借力——因此「每个基准上 scaffold 方差有多准」仍然偏弱;稳健性检查更多是在局部化稀疏的代价,而不是证明稀疏无害。[1]

泛化全域也有边界:对新的「像基准一样构造的任务」泛化,不等于基准代表了全部真实部署用法;对面板内模型群体的可靠排序,也不自动变成对任意新模型的部署保证。留出基准上的 τ 提升是汇合预测效度,不是构造效度或万能能力证明。后验名次区间可以仍然很宽,相邻模型排序概率接近 1/2,有的模型在报告名次与调整名次之间还会跨四分位——池化改善的是设计投影与外部相关,不是魔法消掉所有并列。竞争者集合一变,还要重估可靠度:昨天够用的任务预算,换一批更接近的 frontier 模型后可能不够用。[1]

和站内评测线对照:CIR 关心「同状态下恢复决策的因果效应」;SAGE 关心「自进化变更何时统计上可接受」;Bad Genius / MoMHa 关心 harness 怎么进化、多目标怎么搜;本文关心「比较推断在换任务 / scaffold / 基准后是否还站得住」。几条线不互相替代:系统可以在一个 harness 里可重复,同时它的名次高度依赖那个 harness——可重复性与比较可靠度是两件事。读榜时若只追「再跑几次方差小不大」,会漏掉 scaffold 与基准侧面带来的名次漂移。[1]

收束:多评测 ≠ 更好评测

Leaderboard 数字之所以看起来「硬」,是因为它们被写成单一真相。Hardy 等人的框架把真相拆回主张、对象与设计:固定系统排序可以很可靠;底层模型排序与绝对分往往脆弱得多;堆同类任务有明确天花板(摘要上界约 0.097,OnlineMind2Web 几乎不动);在跨任务主张下,把预算花在多样基准与关键侧面上,通常比盲目加任务更划算。设计评测或读 HAL 风格榜时,顺序应是:先声明分数 / 排名应表示什么 → 诊断限制可靠度的方差来源 → 把预算花在真正重要的不确定上。更多评测只有对准那些来源时才算更好评测。代码与数据见 github.com/hardy-education/scaffold_eval。[1]

参考

[1] Michael Hardy, Ruhana Azam, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo. Agent Evaluation Reliability: More Tasks Won’t (Always) Fix An Agent Leaderboard. arXiv:2610.00651, 2026. https://arxiv.org/abs/2610.00651 · https://arxiv.org/html/2610.00651

[2] 站内对照:CIR、SAGE、Bad Genius、MoMHa。