SAGE:自进化技能别只看总分涨了就合并
你刚把一份 skill 文档「优化」过一版:验证集平均分上去了,仪表盘绿灯,合并进主文档。过两天发现,上周已经能稳做的几类题突然会挂——不是偶发 rollout 噪声,是门控把「修好几题、弄坏另几题」的净涨分当成了进步。自进化环里,优化器负责提案,门控(acceptance gate)负责签字;多数工作把精力砸在前者,后者仍是一句朴素规则:验证总分涨,就接受。
北京大学等作者在预印本 arXiv:2609.36043(SAGE: A Statistical Acceptance Gate for Self-Evolving Agents,2026-09-28;HTML:arxiv.org/html/2609.36043)里,把这道被忽视的门单独做成方法。作者包括 Yihao Wang、Linhan Xia、Rui Liu、Zhaofeng Zhang、Hongyu Wu、Yang Yang、Jinglu He(Xunce Technology)、Yu Guo(GienTech Technology;与 He 共同一作标记)以及通讯作者 Kai Lei(北京大学,[email protected])。他们指出朴素门有两处硬伤:一是永久回归——平均涨分可以掩盖已掌握题被写坏,且接受往往不可逆;二是优化器诅咒(Optimizer’s Curse)——有限、有噪声验证集上「看起来最好」的分数向上偏。对策是 SAGE:同一批验证题上做逐项配对比较,用赢 / 回归 / 平局账本,对回归施加不对称惩罚(λ≥1,先不伤害);再配单侧配对检验(λ=1 时即精确条件二项 / McNemar),只有赢相对输在统计上站得住才提交,否则弃权。边界参数 ((\lambda,\alpha,\tau)=(1,1,1)) 时精确退化回 SkillOpt 基线;SAGE 是保守精细化,只提交基线会提交的那一子集里「更靠谱」的编辑。等预算下五基准 × 四骨干共 20 设定:回归率 19/20 下降(例如 LiveMath 36.5%→0%、OfficeQA DeepSeek-V4 42.8%→0%),终分 20/20 最高(LiveMath 34.15→48.78)。[1]
站内已经写过 SkillDelta(相关≠该注入)、Progressive Disclosure(先披露再按需装)、Bad Genius / CHASE(发布分涨也可能在吃协议捷径)。SAGE 落在另一层:编辑提案已经出来之后,要不要把补丁永久写进 skill。 轻量可对照 RSI 综述 里「谁签字」的问题,以及 HEXIS 把技能编译成可检查状态机——那些文管结构与编译;本文管合并前的统计门。同窗还有 PACE(anytime-valid acceptor,arXiv:2606.08106),也把 acceptor 从 proposer 里拆出来;本文主线仍是 SAGE,PACE 只点到为止。[1]
优化器有纪律了,门控还在「涨分就合」
LLM agent 越来越多靠编辑一份持久 skill 文档——工作流、工具规则、决策逻辑写在外面,模型权重冻结,文档当可训外部状态。环只有两步:优化器提出候选编辑;门控接受或拒绝。论文 §2 把路线画成三层。最早一层是单次输出或推理轨迹内的自改:Self-Refine 在一集内生成–批评–修订;Reflexion 把环境反馈写成短时缓冲里的口头教训;STaR 把成功 rationale 蒸馏进权重。前两者增益随 episode 或缓冲淡掉,STaR 虽持久却埋进参数,人不好盯优化过程是否安全。下一层把自然语言制品当优化对象:OPRO、EvoPrompt、PromptBreeder、TextGrad、GEPA、DSPy 一类做指令或流水线调优;再往 agent 技能伸,Voyager 在探索中长技能库,ADAS 用代码搜 agent 设计,Trace2Skill 把轨迹局部教训收进技能目录。这些方法往往编辑无界、直接吃原始 rollout 反馈,过程吵、难复现。[1]
当前文档侧 SOTA SkillOpt 补的正是优化纪律:把 skill 当冻结 agent 的可训外部状态,用文本学习率限制单步改动量,用拒绝编辑缓冲记住已失败提案,再按 epoch 慢更新,避免反复自改把文档改散。SkillOpt 在主流基准上报告很强,但论文强调:它把力气花在怎么提出更好的编辑;跨方法(含 SkillOpt)的门控仍是——聚合验证分一涨就留下。 形式化里,基线门 (g_0) 就是指示函数:候选在验证集上的聚合分 (J_D) 是否严格高于现任。一行比较,看起来「数据驱动」,证据形态却错了。[1]
两种失败:永久回归与优化器诅咒
第一处失败是证据不足。门控只看见验证集上的一个标量。编辑可以修好一批原来不会的题,同时弄坏一批原来会的题;净平均仍可能上涨。接受一旦发生,坏掉的行为写进 skill,后续优化又在这份已损文档上继续——用已掌握行为换平均分,轨迹被锁进难离开的局部。论文说这类回归不是稀有事件。引言与 Fig.1 给出朴素门在五基准上的回归率区间:ALFWorld 2.5%、SearchQA 4.8%,到 OfficeQA 42.8%;后文 DeepSeek-V4 设定上 LiveMath 也到 36.5%。回归率定义很具体:现任已经解出的验证题里,被接受编辑弄坏的比例。OfficeQA 一类噪声大、协议复杂的任务上,朴素门几乎每接受两次就可能伤到近半已掌握行为——这不是「偶尔翻车」,是签字规则在系统性买回归。[1]
第二处失败是信任过度。验证集有限且有噪声,在候选里挑「观测分最高」会向上偏——Smith & Winkler 意义上的 Optimizer’s Curse。门控把运气好的编辑当成更好,过拟合验证集,表观增益到不了测试分布。自进化环里这两处叠在一起:既看不见「赢了谁、伤了谁」,又把噪声点估计当真相。重复「涨分就合」,技能会朝验证集上局部好看、全局不稳的方向漂移。SAGE 的诊断因此不是「再换一个更强优化器」,而是:接受步骤本身是被忽视的瓶颈。[1]
配对账本:总分是账本的有损投影
SAGE 把接受改写成噪声验证下的统计决策(§3)。沿用 SkillOpt 设定:第 (t) 步门控拿到现任 skill (S^{(t)}) 与一批候选编辑 (E=[e_1,\ldots,e_b]);在持出验证集 (D) 上,用冻结目标模型与二值校验器 (v\in{0,1}) 打分。每个候选生成 (\widetilde{S}n^{(t+1)}=S^{(t)}+e_n)。关键改动:不要只比两个总分,而要在相同验证题上逐项对照现任与候选,记四类结果——双方对、双方错、赢(现任错、候选对)、回归(现任对、候选错)。双方一致的题不提供比较信息;比较信号只在不一致对上。Fig.2 把流水线画成:提案 → 配对账本 → (\Delta\lambda)、(p_\lambda)、(\rho) 三条件 → 提交或弃权。[1]
从账本抽出两个量。设 (w) 为赢数,(\ell) 为回归数,(n_S=|{x\in D:v(S^{(t)},x)=1}|) 为现任已解出的题数。折扣净增益与经验回归率:
[ \Delta_{\lambda}=w-\lambda,\ell,\qquad \rho=\begin{cases}\ell/n_S,&n_S>0,\0,&n_S=0.\end{cases} ]
(\lambda\geq 1) 让一次回归至少和一次修复一样贵,对应「先不伤害」的不对称反事实效用;(\rho) 直接回答「已经会做的题里,这次破坏了多大比例」。(n_S=0) 时回归帽无意义,记 (\rho=0)。聚合总分是这份账本的有损投影:可能出现「赢很多、回归也很多」的假赢家——净分仍涨,但稳健性差;也可能「少量干净赢」才是真改进。SAGE 把结构暴露出来,而不是让它淹没在平均值里。论文特意强调:即便你事后「修正」了聚合分,只要不做配对,仍会吃到一种偏差——配对证据才能告诉你组成,而不只是净值。[1]
单侧检验:赢要相对输「站得住」才提交
光有 (\Delta_{\lambda}>0) 不够。噪声下,少量赢也可能偶然压过回归。论文把总体目标写成折扣增益 (G_\lambda=\Pr(W)-\lambda\Pr(L)),在不一致对上等价于要求真实赢概率 (q) 超过阈值 (q_{\lambda}=\lambda/(1+\lambda))。λ=1 时 (q_{\lambda}=1/2),检验退化成单侧精确 McNemar:把每对不一致当成公平硬币。λ 变大,(q_{\lambda}) 升高,候选必须用更强的赢优势才能抵消每次回归。原假设 (H_0: q\leq q_\lambda),备择 (H_1: q>q_\lambda)。p 值来自以 (q_{\lambda}) 为成功概率的条件二项尾:
[ p_{\lambda}(w,\ell)=\Pr!\bigl[\mathrm{Bin}(m,q_{\lambda})\geq w\bigr], ]
其中 (m=w+\ell)。接受规则三者同时满足才提交(否则弃权,现任不动):
[ \mathcal{A}(e_n,S^{(t)})=I!\bigl[\Delta_{\lambda}>0,\ p_{\lambda}(w,\ell)<\alpha,\ \rho\leq\tau\bigr]. ]
边界 ((\lambda,\alpha,\tau)=(1,1,1)) 时,检验与回归帽几乎不起作用((p_\lambda) 条件与 (\rho\leq 1) 恒真或退化),规则精确回到 (g_0)——SAGE 是包含基线为边界成员的保守族。论文还说明:在 (\lambda\geq 1)、(\alpha\leq 1)、(\tau\leq 1) 的常规区域,SAGE 提交的编辑是基线会提交集合的子集;它过滤的是「增益不可靠」或「靠打破已解题买平均分」的那些。实践含义很清楚:你仍可用原来的优化器;换门,就等于只放行基线本来会放行的编辑子集里,回归受控、增益过统计门槛的。[1]
直觉上可以记三句话。(1) 看配对账本,别只看平均。(2) 回归比多赢几题更贵(λ)。(3) 样本小就弃权——「看起来涨了」不等于「涨得可靠」。同窗 PACE 用 anytime-valid e-过程管可选停止下的假提交,强调「keep if score went up」在反复对着同一噪声 dev 估计时等于失控的自适应多重检验;SAGE 主打固定验证集上的精确条件检验与回归帽,并直接嵌进 SkillOpt 风格的技能文档环。两者都在喊同一件事:acceptor 值得和方法论里的 proposer 同等对待。 评测协议不同,不宜直接横比表内数字。[1]
等预算实验:回归率与终分
评测(§4)固定生成侧为 SkillOpt 优化器,唯一差别是门控;提案次数与 token 预算对齐(equal-budget)。五基准:LiveMath、SpreadsheetBench(SSB)、SearchQA、OfficeQA Pro(文中简称 OfficeQA)、ALFWorld。未测 DocVQA——四条骨干并非都能吃视觉输入,为保持协议一致,多模态留给后续。骨干开放权重四条:DeepSeek-V4-flash、GLM-5.2、MiniMax-M3、Qwen3.6,共 5×4=20 设定。这样比的是「同一提案流,换签字规则」,不是「换了个更会写补丁的优化器」。[1]
回归率(Table 1,越低越好)。 SAGE 在 19/20 设定降低回归率,剩余一档与基线打平(GLM-5.2 × SearchQA,两侧都是 2.4%)。DeepSeek-V4 一行很能说明问题:LiveMath 36.5%→0.0%,SSB 16.6%→0.0%,SearchQA 4.8%→3.7%,OfficeQA 42.8%→0.0%,ALFWorld 2.5%→1.9%。GLM-5.2:LiveMath 27.5%→0、SSB 19.2%→0、OfficeQA 38.7%→0,ALFWorld 9.6%→5.1%。MiniMax-M3:LiveMath 39.4%→0、OfficeQA 45.6%→0,ALFWorld 4.4%→0。Qwen3.6:LiveMath 35.6%→0、SSB 20.2%→0、OfficeQA 39.0%→0。模式稳定:高回归基准上 SAGE 常把回归清到零;SearchQA / ALFWorld 一类基线已少回归的任务,多为小幅再压或持平——门控按设计该「有害编辑少时近乎直通」。[1]
终分(Table 2)。 20 个骨干×基准组合上,SAGE 全部拿到最高终分;相对 vanilla SkillOpt 平均 +8.73 分。DeepSeek-V4:LiveMath 34.15→48.78,SSB 47.56→51.22,SearchQA 81.71→84.15,OfficeQA 32.93→45.12,ALFWorld 66.58→72.92。GLM-5.2 LiveMath 42.12→55.72(约 +13.60)、OfficeQA 44.46→56.19(约 +11.73)。MiniMax-M3 改进最大档:LiveMath 30.97→47.58(+16.61)、OfficeQA 43.19→60.12(+16.93)。Qwen3.6:LiveMath 40.30→57.10(+16.80)、OfficeQA 37.07→47.39(+10.32)。收益不绑死在单一模型或单一任务上;更严的签字没有换来「终分更低」——在等预算下,少合并有害编辑反而抬高了最终 skill。[1]
消融:配对已经有用,检验再加一截
Table 2 还拆了组件。C1(+ paired)只用逐项配对准则(折扣净增益与回归意识),不加统计检验;完整 SAGE 再叠单侧检验。C1 相对 SkillOpt 在每个设定都更好,平均 +6.20 分——说明「别用总分藏回归」这一步本身就很值钱。完整 SAGE 相对 C1 又在全部 20 次比较上再涨,平均再 +2.53 分。以 DeepSeek-V4 LiveMath 为例:SkillOpt 34.15 → C1 46.58 → SAGE 48.78;OfficeQA:32.93 → 40.48 → 45.12。配对负责把有害局部损失从平均里拎出来;检验负责挡住「净增益看起来为正、但赢不赢得过噪声」的假赢家。两者互补,不是二选一;边界参数消融也与「关掉组件回到 (g_0)」的形式结论一致。[1]
论文 §5.1 还点出收益随回归风险缩放。朴素门回归最凶的 LiveMath(36.5%)与 OfficeQA(42.8%)上,SAGE 清零回归,也交出最大终分涨幅;ALFWorld(2.5%)、SearchQA(4.8%)上收益变小。作者写得很干脆:门存在是为了拦截有害编辑;任务很少产出有害编辑时,任何门都几乎无事可做——在可验证、低噪声任务上 SAGE 近乎直通,在噪声大、易回归任务上才真正干活。这正是你希望门控表现的样子:有威胁时介入,无威胁时别乱挡进步。[1]
假赢家长什么样:净涨分也可能不该合
把配对账本摊开,有两类「总分上涨」其实不该过门。第一类是结构假赢家:(w) 很大,(\ell) 也不小,(\Delta_{\lambda}) 在 λ=1 时仍可能为正,但 (\rho=\ell/n_S) 已经刺破你能接受的已掌握破坏比例。朴素门看不见 (\rho),只会看到 (J_D) 涨了。OfficeQA、LiveMath 上朴素回归率动辄三成到四成,正是这类交易在反复发生——用新修好的题,换掉一批本来会做的题。第二类是噪声假赢家:不一致对很少,(w) 只比 (\ell) 多一两个,点估计 (\widehat{q}) 略高于 (q_\lambda),但在二项尾下 (p_\lambda) 过不了 α。Optimizer’s Curse 说的就是:你在一堆候选里挑「看起来最好」的那次,观测优势被选择本身抬高了。SAGE 对前者用 λ 与 τ 加压,对后者用单侧检验弃权;C1 消融说明只做前者已经平均 +6.20,加上后者再 +2.53——两刀切的是不同病。[1]
工程上还有一个容易忽略的后果:接受不可逆(至少在 SkillOpt 式环里,现任被替换后,后续提案都在新文档上生长)。一次买回归的合并,不只亏当前那批题,还污染优化轨迹——后面的「改进」可能是在修补自己引入的伤,仪表盘却仍显示「相对更早的 checkpoint 又涨了」。这和站内 Bad Genius 讲的「发布分好看、协议一挪就塌」是不同轴的问题,但签字纪律上同类:你要的不是某一时刻标量最大,而是可辩护的、不偷偷卖掉已掌握行为的更新。SAGE 把「可辩护」写成可计算的三条件,而不是靠人工 diff skill 文档猜。[1]
再对照注入侧。SkillDelta 问的是:同一 agent、同一任务,注入 skill 相对不注入的增量成功概率 (\tau) 是否为正。SAGE 问的是:同一验证题上,编辑后的 skill 相对现任,赢是否可靠地压过回归。两者都强迫你看到对照臂——无技能 / 现任技能——而不是只看「带新东西时的绝对成功率」。生产仪表盘若只有「带技能成功率」「验证总分」,两道门都会失明。[1]
部署清单:技能 / RSI 环里可抄什么
若你已经在跑 SkillOpt 式「冻结模型 + 持久 skill + 验证集选编辑」,不必重写优化器,优先改签字规则:
- 同一验证题跑现任与候选,落盘 win / regression / tie,不要只存两个标量总分;总分最多当仪表盘,不当唯一合并键。
- 回归不对称计价:λ≥1;生产里对「已掌握行为」设硬帽 τ(回归率上限)。先不伤害比「多赢几题」更优先写进策略。
- 单侧配对检验:不一致对少、样本小时弃权;α 按任务噪声在持出上调,但要承认论文局限——超参仍需人工/持出调,门还不是「零配置」。
- 边界可对照:保留 ((1,1,1)) 作为「回到朴素门」的开关,方便 A/B、审计与回归归因。
- 等预算比较:换门时对齐提案次数与 token,否则「更严的门」会被误读成「跑得少所以分低/高」。
- 校验器形态:当前 SAGE 假设二值 (v);连续奖励要换符号秩一类配对统计,不要硬套 win/loss 计数。
- 轨迹级风险:单次比较的假提交概率受控,不等于整条优化轨迹的错误率受控——验证集跨步复用时,别把单次 p 值当成全局保证。
- 和注入门分工:SkillDelta 决定「这次任务要不要注入某 skill」;SAGE 决定「对 skill 文档的补丁要不要永久合并」。一个在调用前,一个在进化步上。
和站内叙事对齐:Progressive Disclosure 管装多少说明书;SkillDelta 管相关是否等于增益;Bad Genius 提醒发布协议上的涨分可能吃捷径;SAGE 提醒验证平均上的涨分可能买回归。一层层都是:好看的标量,不够当签字依据。 RSI 路线上,谁提案、谁验收,本来就该拆开设计。[1]
什么时候门最值钱,什么时候近乎直通
把 Table 1 与 §5.1 合起来读,五基准大致落进两档。高回归档:LiveMath、OfficeQA(以及多数骨干上的 SpreadsheetBench)。朴素门在 DeepSeek-V4 上 LiveMath 36.5%、OfficeQA 42.8%,SSB 16.6%;SAGE 常把回归打到 0%,终分涨幅也最大(LiveMath +14.63、OfficeQA +12.19)。这类任务校验噪声大、技能文档一改就容易伤到已有路径——门控的「拦截」职能才有用武之地。低回归档:SearchQA、ALFWorld。朴素门本身回归就低(DeepSeek-V4 上 4.8% 与 2.5%),SAGE 多为小幅再压或打平,终分仍略升但幅度小。作者把这总结成:可验证、低噪声任务给优化器很少回归空间,SAGE 退化成近乎直通;噪声任务才是统计门真正干活的地方。[1]
这对选型有直接含义。若你的内部评测已经接近「确定性校验 + 低噪声」(例如强约束的工具调用对错、单元测试全绿/全红),朴素门的伤害可能本来就有限,上 SAGE 更多是加一层安全网与可审计账本,不必指望终分暴涨。若评测像办公文档问答、竞赛数学、表格操作那样,同题多次跑仍晃、技能条文一改就牵动多条路径,先把门从总分比较换成配对+检验,往往比再堆一轮更花哨的提案提示更划算——本文实验里生成侧完全固定,涨分来自「少签坏补丁」。把预算花在更会写补丁的优化器上当然也合理,但若签字规则仍在买回归,更强提案只是更快地把局部最优写进主文档。[1]
另有一层与 harness 进化的对照。CHASE / Bad Genius 盯的是:固定发布协议上自动进化 harness,可能吃基准级捷径;要用反事实协议变换来压增益摧毁。SAGE 盯的是:固定验证集上自动进化 skill,可能吃平均分里的回归与噪声幸运。一个动协议,一个动接受统计;都是在说「自动进化的反馈通道本身会撒谎」。若你同时跑 harness 进化与 skill 文档进化,两道门不妨一起设计:协议鲁棒用 Challenger 档案,技能合并用配对检验——共享「对照 + 弃权」的价值观,而不是共享同一套标量阈值。[1]
局限、未来与同窗
论文 §5.2 自己写得很清楚。方法假设二值校验器;连续或分级奖励需要别的配对统计,符号检验还丢掉幅度,可能对「小而稳定」的真改进不敏感。统计保证是单次现任–候选比较层面的;验证集在优化步之间复用,轨迹级错误率未控。λ、τ、α 仍在持出上调,门控尚未摆脱手工配置。评测为协议一致省略 DocVQA,多模态泛化未证。§5.3 指向的后续包括:分级校验器上的符号秩检验、按任务噪声自适应 α(方差感知 / 时间一致序列置信)、优化器与门控共设计(本文固定生成只换门)、以及多 agent 下局部赢输会被团队交互放大或抵消时的联合接受与信用分配。多模态上补 DocVQA 与 LLaVA 一类骨干,是为了测门是否与模态无关。[1]
代码与数据在投稿期指向匿名仓库 github.com/anonymous-github-repo-123/SAGE——若你复现前仍看到 anonymous 占位,以 arXiv HTML / abs 更新为准。PACE(arXiv:2606.08106)用 testing-by-betting 的 anytime-valid 门在提示词自进化小测试床上压假提交与有害编辑;与 SAGE 同属「acceptor 觉醒」同窗,设定与技能文档环不同,正文不抢戏。[1]
小结
自进化技能文档环里,优化器已经开始有学习率、拒绝缓冲和慢更新;若门控仍是「验证总分涨了就合并」,你会系统性地买入两类错误——用已掌握行为换平均分,以及把噪声里的幸运编辑写进主文档。SAGE 用逐项配对账本暴露回归,用不对称惩罚与单侧检验要求增益可靠,并在边界参数上精确回到 SkillOpt 朴素门,便于对照。等预算下 20 设定:回归率 19/20 下降(LiveMath 36.5%→0%、OfficeQA DeepSeek-V4 42.8%→0%),终分全场最高(LiveMath 34.15→48.78);配对 alone(C1)平均 +6.20,完整 SAGE 再 +2.53。收益随回归风险变大——门控本该如此。下一次 skill 合并前,先问账本上的回归,再问涨分是否过检验;总分绿灯,不够当合并键。[1]
参考文献与链接
[1] Yihao Wang, Linhan Xia, Rui Liu, Zhaofeng Zhang, Hongyu Wu, Yang Yang, Jinglu He, Yu Guo, Kai Lei. SAGE: A Statistical Acceptance Gate for Self-Evolving Agents. arXiv:2609.36043, 2026. abs · HTML · 代码(投稿匿名):anonymous-github-repo-123/SAGE.
相关阅读:SkillDelta、Progressive Disclosure、Bad Genius、RSI 综述、HEXIS. 同窗 acceptor:PACE.