LLM Parkinsonism:Agent 停不住时,谁握有项目级停止权

发布于 2026年9月29日 作者 Remy

Coding agent 的账单,很多人先盯模型单价与缓存命中。站内 Harness 控成本 谈的是路由与治理;三种烧钱习惯 谈的是轨迹里重复检索、相似脚本、空转重测。还有一类浪费更「看起来合理」:硬目标其实已经满足,环却继续加抽象、补边角、写验证、再修自己造出来的复杂度——局部工程仍然自洽,全局「该不该继续」已经变差。

Dongsheng Xiao、Zeyuan Wang、Xuzhe Xia、Bo Zhao、Yankai Cao 在预印本 arXiv:2609.30662 里,把这种「任务级价值递减后仍持续行动」的轨迹模式,用非临床隐喻称作 LLM Parkinsonism,并给出治理架构 Global Executive Control(GEC)v0.2:把行动生成与项目级控制拆开。在 24,000 局、统一 40,000 token 上限的匹配候选基准上:首候选基线硬目标成功率 67.42%,候选集局部控制 96.53%,GEC 96.57%;相对候选集控制,GEC 在成功率几乎持平下,把平均 token 从 19,782 降到 12,574(36.4%),把 40k 上限下的受限完成代价(RMTTC₄₀ₖ)从 16,136 降到 13,114(18.7%),并消掉测得的完成前漂移(GDR_pre)、压低总复杂度堆积。[1]

本篇是机制文,不是临床类比科普。隐喻边界论文自己写得很紧——下文会照抄那条边界。对照阅读时,把它接到 harness 停止权与 token 效率主线上,而不是当成又一篇「agent 爱啰嗦」短讯。

隐喻边界:只借现象学,不借病理

论文 §3 明确:Parkinsonism 在这里只是现象学类比,不主张 LLM 有基底神经节障碍或多巴胺通路问题;也不把「啰嗦」等同于该构念。借的是重复动作幅度/价值递减却停不下来的轨迹形状,并刻意收窄,以免临床误读。作者后来连探索性指标名都从「LLM Parkinsonism Index」改成 Executive Persistence Index(EPI),避免隐喻被当成临床验证。[1]

工程上记住三句话就够:

  1. 这是轨迹级失败模式的名字,不是医学诊断。
  2. 近因假设不是「自回归预测本身」,而是提案、范围解释、进度评估、停止权挤在同一自条件环里。
  3. 处方是外置项目级治理,不是再训一个更会说「我做完了」的模型。[1]

动机例子:双节点灾备监视器

引言用一个紧凑的 Goal Contract:节点 A/B 各自不可用时发对应告警;都不可用时两个节点级条件仍可观测;恢复后回到正确健康态。Agent 却可能「聪明地」引入站点级聚合:A、B 同时不可用时压制单节点告警、改发一条 SITE DOWN——于是多出相关状态、时序窗口、压制规则、合成测试、新失败模式与部署门禁,再花大量 token 调试原目标从未要求的子系统。[1]

这就是论文要区分的两种智力:

  • 解题智力:下一刀怎么砍。
  • 执行控制智力:这刀还在不在被治理的目标里、使能步骤有没有因果理由、复杂度值不值、证据在变更后是否仍有效、现在停是否理性。[1]

经济含义也很直接:在按推理与工具计量费的世界里,不能只看「最终成功了没有」。Cost-aware 评测、长程规划、overthinking、无限 agent 环、以及「自评把忙碌当成进度」的工作,都在同一问题族里;GEC 补的是项目级范围、证据与停止,而不只是压缩 token。[1]

四个组成部分

作者把 LLM Parkinsonism 形式化为四块(与摘要/贡献一致的系统叙述):

  1. Goal drift(目标漂移)——动作与被治理目标失去因果联系,却仍被执行。
  2. Complexity accretion(复杂度堆积)——为可选层、自造边角与维护债持续加码。
  3. Termination failure(终止失败)——硬目标已满足或已无可行路径,却不进入正确终端态。
  4. Token-inefficient persistence(token 低效持续)——在边际任务价值很低时仍消耗大量 token。[1]

主基准里还把指标拆开:完成前漂移(GDR_pre)与完成后 overrun(TOR)分开报;主完成代价用全样本受限均值 RMTTC₄₀ₖ,避免「只统计成功局」偷偷丢掉未完成轨迹。[1]

系统假设:坍塌的执行权威

论文中心论点很短:总能再提出一个合理下一步的模型,不等于知道下一步还值不值得做。 更近的系统假设是:提案生成、需求提升、进度评估、停止权集中在同一自条件环——局部下一步永远「说得通」,全局继续却变差。[1]

因此 GEC 不做「让同一个环更会反省」,而是把治理拆出去。

GEC v0.2:提案与项目级控制分离

图示级结构(§7):模型/生成器负责提案;冻结的 Goal Contract 定义硬/软目标与显式非目标;独立范围裁决给每个候选 ScopeAssessment;证据带状态版本,变更可使旧证据失效;在候选集上算契约对齐期望价值并选净价值最高者;停止是状态级决策,而不是「某一个坏提案被拒就停项目」。[1]

关键机制(按论文口径):

  1. 候选集治理——每环看多个候选(基准里每环 3 个),可拒坏动作而留其它候选;也可在评估完继续集后做经济停止。[1]
  2. 独立范围门——显式非目标 → FORBIDDEN;无因果支持 → NONE;直接/前提/验证/风险缓解/软链接在置信度过阈后才可能合格。不再信任提出动作的同一 LLM 自报的 target_criterion。[1]
  3. 动作级拒绝 ≠ 项目级停止——单个候选 (V(a|s) \le \tau) 只拒绝该动作;经济停止仅当硬需求已完成且继续集中无正净价值候选;硬需求未完成且无可行路径 → STOP_BLOCKED;预算耗尽 → STOP_BUDGET。[1]
  4. 证据携带的成功——STOP_SUCCESS 要求每个硬准则都有仍有效的证据;后续状态变更可使证据作废,防止「过期完工证」。[1]
  5. 合同修订外置——执行器可提议修订,不能自己授权;非目标是可执行合同元素,不是文档装饰。[1]
  6. 无进展熔断——原型在 (k=3) 环无硬进展/有效前提/新外部证据时请求全局重规划;作者坦承在外生候选流基准里该熔断对效率无独立增益,因重规划改不了未来候选,但保留它针对真实 live agent 失败模式。[1]
  7. 删除优先(概念)——自造结构惹祸时优先 DELETE → SIMPLIFY → FIX → ADD;LPB v0.2 未定量隔离该原则。[1]

实现是无依赖 Python 研究原型;仓库见论文给出的 LLM-Parkinsonism-Solutions。[1]

LPB v0.2:匹配候选,才能分清「多看几个候选」与「真治理」

若基线只能看第一个提案、GEC 能看三个,成功暴涨可能只是 best-of-three。LPB v0.2 的关键设计是:策略无关的外生候选集——同一种子预生成候选与随机结果,基线、仅预算、候选集局部控制、GEC 面对同一机会流;治理只能选/拒,不能强迫生成器下一环吐出必需动作。[1]

六类合成任务族:双节点灾备监视、API 发布、数据库迁移、CI 流水线、备份恢复验证、可复现研究流水线。主实验:6 场景 × 4 策略 × 每格 1,000 局 = 24,000 局;硬上限 40k token;根种子 20260911。[1]

四个条件:[1]

条件看见候选独立范围/价值治理
基线局部环只执行第一个无;概率性项目停止
仅预算同序,预算装不下才跳无
候选集局部控制三个;用生成器自报链接 + 代价平局打破无独立范围/证据价值门/复杂度惩罚
GEC v0.2三个;独立裁决 + 契约价值有

作者强调:LPB 是机制隔离试验台,不是真实模型患病率估计;live-model 验证仍必要。[1]

主结果:成功来自候选集,省钱来自治理

主表(§9.1,合成基准,非商业 LLM 实测):[1]

指标基线仅预算候选集局部GEC v0.2
硬目标成功67.42%67.85%96.53%96.57%
平均总 token32,05832,17019,78212,574
RMTTC₄₀ₖ29,02429,02116,13613,114
TOR(完成后 overrun)0.12490.12560.19670
GDR_pre0.27210.27180.12900
Token Efficiency0.03170.03170.05890.0963

解读必须跟论文一致:相对首候选基线,GEC 成功率 +29.15pp、均 token −60.8%;但候选集局部控制已到 96.53%,与 GEC 几乎同成功——多看候选解释了大部分成功增益。相对候选集控制,GEC 的贡献是效率与纪律:均 token −36.4%,RMTTC₄₀ₖ −18.7%,TE 约 1.63×,GDR_pre 从 0.1290 → 0,总复杂度堆积从文中对照叙述的高水平压到与治理一致的低位(主表 GEC Gross CAI 0.1228)。零 TOR / 零 GDR_pre 在很大程度上是控制器不变量在该基准设定下的后果,用来验证治理,而不是拿去营销「永不漂移」。[1]

预算敏感性(§9.2):随上限变宽,GEC 相对仅预算的成功优势扩大;对数预算成功 AUC 为 GEC 0.467 vs 仅预算 0.167(约 2.79×)。含义不是 GEC 凭空造能力,而是把固定候选机会分配到有治理因果相关性、更高期望价值的动作上。[1]

消融:范围权与价值门各自砍什么

§9.3(每场景 300 局量级):[1]

策略成功均 tokenGDR_preGross CAI
Full GEC0.961112,73300.1243
无独立范围权0.952214,0360.07160.3144
无价值门0.960014,50000.1263
无无进展熔断0.961112,31800.1243

去掉独立范围权:完成前漂移回来,总复杂度相对 full GEC 升到两倍以上。去掉价值门:成功仍在,均 token 大约多 1.77k。去掉无进展熔断:在此外生候选流上反而略「更省」——作者把它写成负面证据:熔断针对的 live 失败模式,在改不了未来候选的模拟器里测不出独立好处。[1]

治理开销敏感性:每治理环额外加最多 500 个合成治理 token,相对结论仍有利;作者把这些开销写成模型等价压力测试,而非标定云厂商单价。[1] 另有「有益软工作」探针:硬目标完成后,低成本有益软动作应批准、高成本低价值软动作应拒绝——防止 GEC 被误读成「完成后绝对禁止一切」。[1]

「停不住」在生产里长什么样

把论文四元组映射到值班时能看见的症状,比背术语有用:

论文组件值班时常见外观错误归因更像样的探针
Goal drift开始改「顺手做的」监控/聚合/重构,PR 描述仍写原 ticket「模型太主动」动作是否链到合同里的硬准则或已批准前提
Complexity accretion为可选层写测试、再为测试写修复,diff 行数涨、业务验收项不变「工程质量高」自造文件/服务数、净复杂度是否只涨不跌
Termination failure验收已绿仍继续「再确认一次」;或明显 blocked 却无限重试「谨慎」是否进入 done / good-enough / blocked / budget
Token-inefficient persistence账单后半段陡升,外部效用平坦「上下文太长」完成前后 token 分段;TOR / 尾部 TE

站内三种烧钱习惯文里的 ReTest,经常是终止失败的一种薄外观:patch 没变,测试却再跑。[2] Parkinsonism 视角多问一句——是检测器没拦住重复,还是项目级根本不该再有下一步? 两层都要修。

与「再加一段请停止的提示」有什么不同

团队常试的补丁是:在系统提示里写「完成后停止」「不要过度工程」。论文相关工作把 Reflexion 一类自反馈环放在「强但制造控制问题」的位置——局部合理的下一步,不蕴含全局仍值得继续。[1]

GEC 的差异不在「话术更严厉」,而在权威位置:

  1. 范围裁决不信任提案者自报链接;
  2. 完工依赖外部/状态版本化证据,而不是模型说 DONE;
  3. 合同修订不能由执行器自批——与安全侧「agent 不能自批提权」同构。

若你的「停止提示」仍由同一 completion 解释,你只是把停止权又塞回了那个自条件环。

预算天花板为什么不够

仅预算臂与基线成功率几乎贴在一起(约 67–68%),说明硬 token 上限 alone 选不出高价值工作——装得下的低价值动作仍会被执行。[1] 预算敏感性表更狠:在 12k 上限,仅预算成功约 6.89%,GEC 约 54.11%;到 40k 才分别到约 68.67% / 96.33%。[1]

对采购与平台团队,这意味着:把「给够 token」当成治理,会在中等预算区最吃亏——钱花了,硬目标仍大量未完成;而治理臂把同一机会流拧向有因果链接的动作。论文用对数预算 AUC 概括全区间效率,避免只盯一个任意阈值。[1]

Live 验证协议:别把模拟数字贴到产品页

§12 预写了配对 live 实验:同一基座模型、温度/推理设置、工具面、Goal Contract 与验收准则,在基线 / 仅预算 / GEC 下对比;主终点是外部裁定的硬目标成功,以及全样本受限完成代价(含未完成),避免条件化完成时间偷删失败局。[1]

次终点包括条件完成 token、TE、TOR、GDR_pre、复杂度、工具调用、墙钟、合同修订次数、验证器作废事件、重尾分位;独立范围裁决器与验证器的推理成本必须计入;范围链接应抽样双人/盲评复核;能用确定性检查时,不要让提案-执行的同一 LLM 独家宣判完工。[1]

任务集应覆盖:多步前提、合法有益软改进、需授权修订的变目标、后写坏前证据、正确结局是 BLOCKED 的题。模型族至少含一个前沿推理模型与一个低成本模型。[1]

把这段写进内部实验设计,比把 36.4% 直接印到销售页更负责任——36.4% 是相对候选集控制、在合成 LPB 上的均 token 降幅。[1]

和站内成本/ harness 文怎么接

  1. 三种烧钱习惯(t299)——SubRetrv / SimScrpt / ReTest 是轨迹内可检测的重复劳动。[2] Parkinsonism 更偏项目级继续决策:目标已够仍加层。两者常叠在一起:空转重测可以是 ReTest,也可以是终止失败的一种外观。
  2. Harness 控成本——账单责任常在 harness 默认,不在「模型贵」。[3] GEC 把「停止权」显式标成 harness/治理层对象,而不是希望模型自己悟。
  3. 扩张 harness 而非堆上下文——把反复出现的控制长成代码。[4] 范围门、价值门、证据版本、终端态枚举,正是该长进代码的控制,而不是再塞一段「请及时停止」的提示。

DNS pause / MoMHa 等若未发正式 slug,本文不链。机制上「外置停止/外置批准」与 OpenShell Policy Advisor「agent 不能自批」同族——今天上午的 OpenShell 文谈安全停车绳;本文谈经济与范围停车绳。

软目标与「完成后绝对禁止」的误解

有益软工作探针故意放在硬准则已经有效完成之后:候选集里同时有低成本有益软动作与高成本低价值软动作。GEC 应批准前者、拒绝后者,并继续,而不是因为看见一个坏软候选就宣布经济停止。[1]

这直接打脸两种产品误读:

  1. 「治理 = 永远尽早停」——真正要的是边际价值门,不是禁欲。
  2. 「软目标可以偷偷变成硬成功」——论文把软目标价值单独加权(β),不能无声并进硬效用。[1]

写 Goal Contract 时,把「文档润色 / 额外可观测性 / 可选重构」放进软栏,并规定谁有权在中途把某条软目标升成硬准则——升格本身应走合同修订,而不是让 agent 在轨迹里自我提权。

噪声稳健:优雅降级,而不是一碰就崩

§8.9 / 结果侧对范围误报误拒与验证器噪声做了简单压力(名义水平 0、0.02、0.05、0.10)。实验意图是测优雅降级,不是标定真实验证器误差率。[1] 对工程的启示是:独立裁决器也会错,系统设计应允许抽样审计与人工覆写,而不是假设「外置 = 永真」。把范围门做成可观测决策(FORBIDDEN / NONE / 链接类型 / 置信度),比做成不可解释的黑盒二次模型,更利于事后纠错。

Harness 设计师清单

  1. 把 Goal Contract 写死并版本化。 硬准则、软目标、显式非目标分栏;修订走外置授权,执行器只能提议。
  2. 停止权离开提案模型。 至少:独立范围检查器(规则/第二模型/形式条件)+ 证据校验;不要让同一 completion 既写 patch 又宣判 DONE。
  3. 终端态要分清。 done / good-enough(经济停止)/ blocked / budget ——「没做成却一直试」应进 blocked,而不是假装成功。
  4. 拒动作 ≠ 停项目。 单候选低价值只拒该步;项目停止看「硬需求是否完成 + 继续集是否还有正价值」。
  5. 证据带版本。 改了相关状态就作废旧完工证;对照「自评把忙碌当进度」类失败。[1]
  6. 先测候选集,再测治理。 若你的 A/B 里实验臂能看 K 个候选、对照只能看 1 个,先加「候选集局部控制」臂,避免把 best-of-K 记成治理胜利——论文的方法学核心。[1]
  7. 熔断针对真实失败模式。 无进展重规划在外生候选模拟器里可能显不出好处;在 live 环里仍值得留,但要用 live 指标验收。[1]
  8. 把治理 token 算进账单。 独立裁决器与验证器的推理成本必须计入;论文对 live 协议也要求如此。[1]
  9. 与轨迹浪费检测联用。 ReTest/SubRetrv 检测器管「重复劳动」;GEC 类治理管「该不该还有下一步」。
  10. 删除优先写进默认策略。 自造复杂度引发的失败,默认先删/简化再叠加修复——即便基准尚未定量,也是可执行的工程默认。[1]

局限(照抄论文诚实处)

  • 主数字来自合成机制基准,不是某家商业模型的线上 A/B;作者专章写了 live-model 验证协议。[1]
  • 零 TOR / 零 GDR_pre 大量由默认独立范围门与确定性证据终止强制出来,用于验证不变量。[1]
  • 无进展熔断在 LPB v0.2 上无独立效率证据。[1]
  • 隐喻有误读风险;中性替代表述可以是 agentic executive-control persistence。[1]

结语

弱点往往不是「不会做」,而是很会做的时候,仍缺少项目级执行控制。Agent 可以极擅长回答「下一步能做什么」,却不可靠地回答「还应不应该做」。GEC v0.2 的压缩规则是:

  • 无被治理的因果链接 ⇒ 动作成不了必选项;
  • 单动作低价值 ⇒ 拒绝该动作,不是停掉整个项目;
  • 硬需求完成且无正价值继续 ⇒ 经济停止;
  • 硬需求未完成且无可行路径 ⇒ blocked,不是假装成功。[1]

对 harness 设计师,这意味着:把范围、证据、预算与停止权做成模型够不到的一层——与今天上午谈的安全边界外移,是同一张控制面地图的两边。

参考来源

  1. Xiao D, Wang Z, Xia X, Zhao B, Cao Y. LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents. arXiv:2609.30662, 2026-09-25. https://arxiv.org/abs/2609.30662 · PDF https://arxiv.org/pdf/2609.30662 · code https://github.com/DongshengXiao/LLM-Parkinsonism-Solutions
  2. 站内:Coding Agent 烧钱的三种习惯
  3. 站内:Control the Harness, Control the Cost
  4. 站内:扩张 Harness,而不是堆上下文