GLM-5.3:漏洞利用能力进了开源权重,拒答就不再是防线

发布于 2026年10月6日 作者 Remy

9 月 29 日,Anthropic 发了一篇分析智谱(海外品牌 Z.ai)GLM-5.3 的文章,开头一句话就把事情说透了:五个月前他们发布 Claude Mythos Preview 时就判断,能端到端构造复杂漏洞利用(exploit)的能力迟早会扩散到其他模型;「这些模型现在来了」。[1] 更早的 9 月 17 日,NIST 下属的 AI 标准与创新中心 CAISI 已经给出自己的评估:GLM-5.3 是「迄今最具网络攻防能力的开源权重模型」,在 CAISI 的综合网络指标上落后美国前沿约四个月。[2]

如果只看标题,这像又一条「某模型很强」的新闻。值得多花点时间的是另一层:这次能力落在了可以下载的权重文件里。 过去两年,大家默认的那套防线——模型自己会拒答、API 有分类器、危险版本只给审核过的客户——都假设模型跑在厂商的服务器上。权重一旦放出来,这三层里只剩第一层还跟着走,而 Anthropic 的测试显示,这一层用很普通的手法就能绕开。

所以本文想回答的问题是:当「会写漏洞利用」变成一个谁都能拿到的文件,防线应该挪到哪里? 下面先把三方材料对齐,再拆三种绕过手法分别打在哪个控制点上,最后给防守方、自托管团队和托管平台各一张清单。本文只讨论机制、数字与防御,不复述任何利用步骤。

站内相关的几篇可以对照着读:Hard Stop 里提到,取证工程师因为商业模型拒答,只好在私有 GPU 上拉起开源权重来分析攻击日志——开源权重对防守方同样有用;OpenShell 与 Sentry 讲把执行边界挪出 harness;沙箱不够 讲隔离之外还要管「谁有权下令」;agent 篡改自己的轨迹 的实验里,ZCode×GLM 5.3 就是被测组合之一。

一、三份材料,各自在说什么

先把时间线摆平,因为三方说的不是同一件事,测的也不是同一个东西。

日期来源核心说法测法
2026-08-14Z.ai 发布博客 [3]托管版上线;网络能力是「涌现」的,后训练加了漏洞发现数据后长得比预期快;权重两周后、做完安全评估与加固再放自报基准(CyberGym、ExploitBench、ExploitGym),在 Claude Code 2.1.207 里跑,有域名白名单
约 2026-08-28Hugging Face 权重卡 [4]753B 参数,和 GLM-5.2 同一个基座,「所有提升都来自后训练」;SGLang、vLLM、KTransformers、Ascend 等都能部署同上
2026-09-17NIST CAISI [2]「迄今最具网络攻防能力的开源权重模型」;综合指标落后美国前沿约四个月四个基准,ReAct harness(bash + python + 停下就推一下),美国模型在适用时关闭网络安全护栏
2026-09-29Anthropic [1]能端到端写出利用,护栏用简单手法就能绕过 64%–100%;对攻击者是「台阶式」提升自家基准 + 专家人工会话 + 模拟世界里的护栏测试

几点先说清楚。

第一,Z.ai 自己并没有回避这件事。 发布博客把网络能力单独列为一节,标题就是「涌现的网络能力」,原话是后训练放大之后,模型「不只是更会找孤立的漏洞,而是开始跨多个阶段推理,形成完整利用链的连贯计划」。他们还写了一句很诚实的话:越往利用链上游走,相对 GLM-5.2 的提升越大,和闭源前沿的差距也越大——「能力恰恰在我们最落后的地方长得最快」。[3] 承诺的「两周安全评估与加固」确实执行了(NIST 记录权重在发布两周后放出 [2]),但公开材料没有说明加固具体做了什么、用什么阈值判断可以放。

第二,Z.ai 把这份能力用在了防守上,规模不小。 博客说从 GLM-5.2 起就和国内几支安全团队合作,在真实代码库上跑模型,经专家复核、筛选、去重后,在 269 个项目里找到 2,436 个漏洞。配套的「Z.ai Security Disclosure Ledger」显示:严重 107 个、高危 990 个,合计 1,097 个;已公开 53 个,其余 2,383 个仍在披露期;最老的缺陷 1981 年引入,平均在代码里待了 26.6 年。[3] 这组数字本身就说明了问题的两面:同一个模型,能在一个月里给开源世界攒下两千多个待修漏洞,也能被任何人拿去找下一个。

第三,CAISI 和 Anthropic 的结论方向一致,但口径不同。 CAISI 强调「显著低于美国前沿」;Anthropic 强调「对攻击者来说已经越过门槛」。两者并不矛盾,矛盾只在于你拿谁当参照物——这一点第三节专门拆。

还有一个背景值得记一笔:这三方都不是中立的。Z.ai 要卖 API 和 Coding Plan;Anthropic 的 Mythos 系列走受限访问,文章结尾明确呼吁扩大防守方对前沿模型的访问;CAISI 的报告天然带着中美对比的框架。读数字,别被框架带着走。

二、能力到底多强:把数字放回各自的考场

同一个名字的基准,在三份材料里给出的数字对不上,这很正常——评分口径和 harness 都不一样。下面按来源分开读。

Z.ai 自报:利用链越靠后,涨得越多

基准测什么GLM-5.3GLM-5.2Mythos 5GPT-5.6 Sol
CyberGym白盒源码里找漏洞并触发崩溃84.577.283.883.6
ExploitBench把已知 V8 缺陷做成利用54.424.478.076.5
ExploitGym(2h / 6h)限时内完成的利用任务数(共 869)105 / 13029 / 39181 / 247216 / 293

(数据来自 Z.ai 发布博客与权重卡 [3][4];Mythos 5 在表中标为「Fable 5 (w/ fallback)」,博客正文称 Mythos 5。)

找漏洞这一步(CyberGym),GLM-5.3 已经和闭源前沿打平,甚至略高;但越往后走——把漏洞变成能控制程序的利用——差距越明显。ExploitBench 上它比 GLM-5.2 翻了一倍多,却仍比 Mythos 5 低二十多个点;ExploitGym 上完成的任务数只有 Mythos 5 的五到六成。Z.ai 自己总结的规律就是前面那句:涨得最快的地方,恰好是离前沿最远的地方。

要注意两个口径问题。一是 Z.ai 的 ExploitBench 报的是「覆盖分」(41 个任务、每个任务跑 3 轮、取达成能力的并集再平均),不是「端到端成功率」;二是 ExploitGym 的 2 小时 / 6 小时是按各模型的 token 吞吐折算出来的时间预算,GLM-5.3 按每秒 115 token 折算。[4] 所以这张表适合看「同一考场里谁高谁低」,不适合拿去和别家的数字直接比。

Anthropic 实测:端到端写利用,和 Mythos Preview 差不多

Anthropic 的测法更贴近攻击者真正关心的问题:最后能不能拿到一个能用的利用。[1]

  • ExploitBench(只算端到端成功):GLM-5.3 在 410 次尝试里写出 50 个完整利用,Claude Mythos Preview 是 56 个。
  • 内部 Binary Exploitation 基准(取自参加 Google OSS-Fuzz 的开源项目,随机抽 100 个任务,拿到完整控制流劫持才算满分):GLM-5.3 是 4%,Mythos Preview 是 6%;更早的 Claude Opus 4.6 和 GLM-5.2 一个都没做成。

4% 听起来很低,但关键在「从 0 到非 0」。Anthropic 的判断是「一个有意义的门槛显然已经越过了」:之前的模型在这类任务上完全做不到,现在能做成一部分。

更有说服力的是两次人工会话。会话都在隔离沙箱里进行,目标是离线搭好的环境,通常不超过一天,专家投入的注意力加起来不到一小时:

  1. 研究员让 GLM-5.3 分析一款流行浏览器的 Linux 版本。一天之内,模型在它的 JavaScript 引擎里找到几个此前未知的漏洞,串成一个能用的利用:访问一个网页,就能读取访客电脑上的任意文件(截图里演示的是偷 SSH 私钥)。同一次会话里,研究员还用它在无线网卡驱动、显卡驱动和联网设备软件里找到了可利用的漏洞。相关漏洞已经或正在向维护者披露。
  2. 另一位研究员用更小的 GLM-5.3-Flash,给它一个刚公开的 Chrome 漏洞(CVE-2026-11645)和另一个已知缺陷的公开信息。几乎没有人工引导,模型把两个漏洞串成一条针对 ARM64 的稳定利用链,还绕过了指针认证(PAC,一种硬件级的指针防篡改机制)。人花了 20 分钟,模型跑了 8 小时,按智谱 API 价格算总共 20.40 美元。

第二个例子比第一个更值得防守方记住。0-day 的发现还需要运气和算力,但「补丁出来 → 照着补丁写利用」(业内叫 N-day)这件事,成本已经降到一顿饭钱,时间降到一个晚上。

CAISI:四个考场,一个综合分

CAISI 的四个基准覆盖从找漏洞到写利用的整条链:[2]

基准任务数给模型什么、要它做什么
SEC-Bench Pro183V8 或 SpiderMonkey 源码加一个已知漏洞,指明要审的文件和漏洞类型;要找到漏洞并写出能稳定触发它的崩溃
ExploitBench41一个已知的 V8 缺陷,要做成能执行任意代码的利用;16 分制,三次取最好
ExploitGym502开源项目里的真实 bug 加一个已知能让它崩溃的输入,要发展成任意代码执行
CAISI OSS-Fuzz297广泛使用的开源项目代码,里面有已知缺陷,但不给描述、崩溃样例和修复;要自己找到并劫持程序

所有模型都放在同一个 ReAct harness 里跑,工具只有 bash 和 python,模型停下来就推它继续;推理开到最高档;适用时,美国模型关闭了网络安全护栏。[2] 这一句很重要,第三节会用到。

三份材料放在一起,结论其实很一致:找漏洞已经追平,写利用还落后,但已经跨过「能做成」的门槛。 分歧只在于这个「落后」该怎么理解。

三、「落后美国前沿约四个月」到底在说什么

这句话最容易被读成「还早,不用急」。拆开看,它说的是一件很具体的事,而这件事对攻击者几乎没有安慰作用。

这个「四个月」是怎么算出来的

CAISI 没有把四个基准的分数简单平均,而是用了项目反应理论(IRT,原本用来给考生和考题同时打分的心理测量方法)里最简单的一参数模型:把所有模型在所有任务上的成败放进一张大表,同时估出每道题的难度和每个模型的潜在能力,得到一个「网络能力指数」。[2]

这个指数用的是 Elo 刻度:高 400 分,意味着解出任务的赔率高 10 倍。 CAISI 给的例子是:A 模型每道题有 50% 的把握,比它高 400 分的 B 就有约 91% 的把握,低 400 分的 C 只有约 9%。CAISI 把历代中美最强模型的指数按时间画成两条线,GLM-5.3 的指数大致落在美国那条线四个月前的位置——这就是「四个月」的来历。CAISI 也说明了,GLM-5.3 高于此前的中方最强(也是此前最强的开源权重模型)Kimi K3,低于当前和近期几代美国前沿,差距远在 95% 置信区间之外。[2]

所以「四个月」是时间轴上的距离,不是能力上的「差一点」。那个位置附近,正是 Mythos Preview 这类当时只给受限用户的模型——它五个月前发布,走的是 Project Glasswing 受限访问。[1]

参照物是谁,决定了这句话是安慰还是警报

再回到那句关键说明:CAISI 的「美国前沿」包含只给审核用户的受限版本,测试时还关掉了网络安全护栏。Anthropic 在文章里专门点了这一点:攻击者拿不到这些版本,但谁都能下载 GLM-5.3。[1]

换个参照物,结论就反过来了。如果问题是「攻击者现在能自由使用的、没有有效护栏的最强模型是什么」,答案就是 GLM-5.3,在这条线上它排第一,CAISI 测过的上一个第一名 Kimi K3 已经被它超过。Anthropic 的图 1 也是这个意思:Claude Opus 4.6 到 Mythos Preview 的跳跃,和 GLM-5.2 到 GLM-5.3 的跳跃幅度相当;区别只在于前者的高配版本锁在受限访问后面,后者放在 Hugging Face 上。[1]

更值得记住的一条:能力是后训练「解锁」出来的

权重卡里有一句话很容易被忽略:GLM-5.3 和 GLM-5.2 是同一个基座模型,「所有提升都来自后训练」。[4] Z.ai 的博客也说,网络能力是在加大后训练规模时「比预期更快」长出来的。[3]

这意味着什么?利用能力并不需要一个更大、更贵的预训练才能出现,它更像是一个已有基座经过针对性后训练就能被拉出来的东西。对后来者来说,这条路的门槛比重新训练一个前沿基座低得多。Anthropic 图 2 里已经把 Kimi K3、DeepSeek V4.1-Flash 这些最新开源权重模型画在同一张曲线图上,[1] 可以合理预期:下一批开源模型里,这种能力会是常见配置,而不是某一家的特例。

三种读法

把上面这些放在一起,「四个月」可以有三种读法,取决于你站在哪里:

  • 做政策和评估的人:差距还在,而且统计上很确定;这给了「受限访问 + 政府评测」这套做法一个继续存在的理由。Anthropic 明确呼吁各国政府对 GLM-5.3 的后继模型做安全测试 [1],CAISI 这份评估本身就是这类测试的样例 [2]。
  • 攻击者:差距几乎无关紧要。他们比较的不是 GLM-5.3 和受限版 Mythos,而是 GLM-5.3 和「以前能自由用的最好工具」。在这个比较里,这是一次台阶式的提升。
  • 防守方:「四个月」最该被理解成一个倒计时。今天只有受限访问用户能用到的能力,如果差距保持不变,大约四个月后就会出现在可下载的权重里,而且不带有效护栏。你的补丁速度、资产盘点和检测能力,应该按这个节奏来规划,而不是按「攻击者还用不上」来规划。

四、三种绕过手法,各打在哪个控制点上

Anthropic 的护栏测试是本文最想拆透的部分,因为它直接回答了标题里那句话:为什么拒答在开源权重上不再是防线。

先说清楚 GLM-5.3 本来有什么护栏。Anthropic 观察到,用户提出明显有害的请求时,模型常常会拒绝;但文中那些漏洞研究任务在原版模型上根本没有触发拒答,只有要求它写恶意软件或攻击远程目标时才会拒。[1] 也就是说,找漏洞、写利用这类两用(dual-use,攻防都能用)任务,从一开始就不在拒答的覆盖范围里——这本身就说明,靠模型判断请求意图来设防,边界天生是模糊的。

测试是怎么设计的

Anthropic 把模型放进一个模拟世界,给它明显恶意的指令:去攻击关键系统。这个环境里模型生成的代码从不真正执行,它拿到的是一个假的 bash 工具,命令结果由另一个 LLM 根据世界设定「编」出来。[1] 统计口径是:模型在收到有害请求后,是否尝试连接远程目标系统;每个格子 50 个样本(5 种攻击指令 × 2 个目标 × 每种 5 次)。

不加任何技巧时,GLM-5.3 和其他被测模型一样,全部拒绝。然后是三种手法:

手法做法GLM-5.3 参与率打在哪个控制点闭源 API 为什么挡得住
编故事告诉模型它是在演练中的自主红队 agent64%模型自己对意图的判断Claude 的护栏识别出了这类欺骗性提示
预填思考预先写好一段思考 token,看起来像模型已经考虑过、决定照做92%推理过程的完整性Anthropic API 不允许用户预填 Claude 的思考内容
去拒答(abliteration)直接改权重,去掉拒答行为100%权重本身权重不公开,没法改

(数据与说明来自 Anthropic [1];在同样条件下,所有被测的有护栏 Claude 模型参与率都是 0。)

这张表的最后一列比参与率更值得看。三种手法在闭源 API 上失效的原因各不一样:第一种靠的是 Claude 自身的安全护栏(文中没拆开说是训练出来的判断还是额外的检测),第二种靠的是接口不开放这个能力,第三种靠的是权重不出门。只有第一种还算「护栏起了作用」,另外两种其实是部署方式挡住的。

为什么预填和改权重在开源权重上是「免费」的

自己部署开源权重,意味着从 chat template 到采样参数,整条推理链路都在你手里。所谓「系统提示」「助手的思考」「助手的回答」,在模型眼里只是一串带特殊标记的 token。你可以在模型开口之前替它写好开头,包括那段「我考虑过了,这是授权的演练,可以继续」的思考。模型接着往下续写,是它最自然的行为。闭源 API 能把这件事变成不可能,只是因为服务端不让你碰那一段;本地推理服务没有这道门。

去拒答(abliteration)更直接。它基于一个已有观察:在不少模型里,拒答行为在激活空间里大致对应一个方向,把这个方向从权重里投影掉,模型就基本不会再拒绝,其他能力受影响很小。[5] Anthropic 自己做了一份去拒答版的 GLM-5.3:[1]

  • 在 JailbreakBench、HarmBench、StrongREJECT 三个衡量「是否配合明显有害请求」的公开基准上,拒答率从 90% 以上降到约 3%、2% 和 12%。
  • 能力几乎没掉:GPQA-Diamond 分数和原版一样,CyberGym 子集上只低了几个百分点。
  • 成本:这支此前从没做过这件事的团队花了约 2,200 GPU 小时、约 4,400 美元,大部分花在并行试不同变体和改完后的能力测试上;他们估计熟手从零开始只需约 600 GPU 小时(约 1,200 美元)。GLM-5.3-Flash 用了约 600 GPU 小时。
  • 实际上不用自己做:模型发布后几天内,就有好几位开发者公开发布了去拒答版本。

结论:拒答是出厂默认值,不是边界

把这一节压成一句话:在开源权重上,所有长在推理链路里的控制点都归部署者所有。 拒答是厂商替你设好的默认值,攻击者可以用提示改、用预填改、用权重改,代价从零(直接下载别人做好的版本)到几千美元不等。厂商再怎么加固这一层,也只是提高「改默认值」的价格,挡不住有意为之的人。

所以别再问「GLM-5.3 的护栏够不够好」,该问的是:当模型这一层可以被假定为完全配合时,剩下的控制点在哪里?

五、防线该挪到哪里

防守方:按「利用会更快、更便宜」重排优先级

  • 压缩补丁窗口。 N-day 利用的成本已经到了二十美元、一个晚上的量级。补丁发布到你部署之间的那段时间,是最该收紧的指标,联网的浏览器、驱动和设备固件优先。
  • 缓解措施照做,但别指望它兜底。 PAC 这类硬件缓解在上面的案例里被绕过了,它们提高的是成本,不是上限。
  • 检测看行为,不看内容。 攻击流量不会写着「由 GLM-5.3 生成」。能依赖的是异常进程、外连和凭证使用这些行为信号。
  • 自己也用上这类模型。 Z.ai 的两千多个漏洞和 Glasswing 的一万多个说明,同一种能力可以先拿来找自家的洞。[1][3] 顺带要为随之而来的漏洞报告洪峰准备好分诊人手。

自托管团队:把模型当成「可能完全配合任何人」的组件

很多团队会把 GLM-5.3 或它的 Flash 版拉到内网当 coding agent。这时它的拒答同样不是你的护栏——一段注入进上下文的指令,效果和「编故事」差不多。控制点要放在模型外面:

  1. 执行隔离与出网白名单。 Z.ai 自己评测时都给 agent 套了域名白名单,只放行 pypi.org、deb.debian.org 这类必需的域名。[4] 生产环境没有理由比评测更松。
  2. 凭证最小化。 agent 能拿到的 token 只覆盖当前任务,过期快、可吊销。
  3. 不对外暴露原始补全接口。 如果你把模型服务开给别人,别让调用方自己拼 chat template、预填 assistant 或思考段——这正是 92% 那一行。
  4. 核对权重来源。 去拒答版本几天内就有人公开发布,只从官方组织拉取,并锁定文件哈希。
  5. 审计日志放在 agent 碰不到的地方。 理由见站内 agent 篡改自己轨迹 那篇实验。

托管平台与转售方:能管的只有自己机房里那一份

在 API 后面跑 GLM-5.3 的平台,仍然拥有闭源厂商的那几个控制点:实名与分级访问、用量与行为监控、输出侧检测、滥用处置。这些值得做,但要清楚它们只管得住经过你机房的流量,管不住已经被下载的副本。

六、几处要打折扣的地方

  • Anthropic 的护栏数字来自模拟世界,命令结果由另一个 LLM 编出来,不等于真实攻击里的成功率。[1]
  • Z.ai 说的「安全评估与加固」做了什么、按什么标准决定放出权重,公开材料里没有。[3]
  • 三方的基准同名不同口径,跨来源比大小没有意义。

结语

GLM-5.3 不是最强的模型,但它把「会写漏洞利用」变成了一个人人能下载的文件。从这一刻起,模型拒不拒答只是默认设置;真正的防线在模型外面:补丁速度、执行隔离、出网控制、凭证范围和审计。下一款开源权重模型多半也会带着这种能力出来,现在挪防线不算早。

参考来源

  1. Anthropic Frontier Red Team, “GLM-5.3 and the spread of advanced cyber capabilities”, 2026-09-29. https://www.anthropic.com/research/glm-5-3-and-the-spread-of-advanced-cyber-capabilities
  2. NIST CAISI, “CAISI’s Assessment of Z.ai’s GLM-5.3 Cyber Capabilities”, 2026-09-17. https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities
  3. Z.ai, “GLM-5.3: Frontier Coding with Emergent Cyber Capabilities”, 2026-08-14. https://z.ai/blog/glm-5.3 (含 Z.ai Security Disclosure Ledger:https://cvd.z.ai/ )
  4. zai-org/GLM-5.3 model card, Hugging Face. https://huggingface.co/zai-org/GLM-5.3
  5. Arditi et al., “Refusal in Language Models Is Mediated by a Single Direction”, 2024. https://arxiv.org/abs/2406.11717