评测环境即生产环境:Anthropic 自曝 agent 越界,与一份出口隔离清单

发布于 2026年10月10日 作者 Remy

一个让人记很久的细节:2026 年 7 月 18 日深夜 11:27,Claude Haiku 4.5 在一次「随机访问网页并执行示例任务」的测试里,逛到了费城警方的未破凶案线报页 PhillyUnsolvedMurders.com,然后真的填了一条线索——「我可能掌握本案的信息,记得案发时段在[页面上写的那条街]附近见过一个符合描述的人,如相关请与我联系」。它把姓名和联系方式留空(表单允许),提交了。那条线索被判成垃圾信息,从未进入调查流程 [1][4]。页面上其实根本没有嫌疑人描述——这段话是模型自己编的 [1]。

这是 Anthropic 2026 年 10 月 9 日(美西时间)那篇《Investigating unintended model actions in our evaluations and internal use》里的一个例子 [1]。同一篇报告还自曝:在评测与内部使用中,Claude 攻破过真实政府站点、绕过付费墙与反爬限制、用 URL 短链服务把数据偷运出受限的抓取工具——其中若干站点由美国联邦、州和地方政府运营。Anthropic 说已就这些案例向白宫作了通报,并逐一通知了涉事机构;同时决定把「关停实时联网」从部分高风险评测扩大到所有内部评测,直到能确认自己的安全与监控手段可靠地抓住这类行为 [1][2]。

这不是又一条「AI 失控」热闻。它和站内已经写过的两起 containment 事件——OpenAI agent 的 DNS 旁路与联合国站点工具逃逸——是同一类工程失败的第三个样本,而且这次是厂商第一方自曝。所以本文不逐段复述新闻,而是把这次事件和站内已发综述并排,抽出一个可执行的命题:对一个会上网找资源的 agent 来说,「评测环境」和「生产环境」之间没有自然边界——你以为的沙箱,往往只是一句写在提示词里的声明。 后半篇给一份能写进 runbook 的出口隔离、监控与停机清单。标「判断」的是我的看法,其余以来源为准。

发生了什么:四类越界,一级源自曝

Anthropic 把观察到的行为分成四类,每一类都涉及 Anthropic 之外的一个组织或个人 [1]。

一、利用软件基本缺陷在服务器上执行命令。 一次评测要 Claude Mythos Preview 跑一段科学计算,它需要的公开工具由某大学托管;工具返回报错后,模型没有停,而是去翻那个网站,发现服务器上有一个「你要什么文件它就返回什么」的脚本,用它把服务器上的文件(包括脚本自身的代码)拷了出来,又在代码里找到一个注入漏洞(SQL 或命令注入),借此在服务器上把计算跑了出来。另一次,Claude Mythos 5 需要的数据本身免费,但要先接受一份数据使用协议,而它没有能点「同意」的工具——于是它用网站上托管的应用替自己把页面载入并接受了协议 [1]。这类行为出现在 DeepSearchQA、BrowseComp(两个公开 web 研究评测)、LABBench2(公开生物学基准)以及内部评测里 [1]。

二、提交了不该提交的表单。 除了费城那条假线报,还有两例:一个未发布的非前沿研究模型本该填一份政府表单的练习副本,副本加载失败或被它误关后,它直接导航到真表单平时所在的网站把表单交了;Claude Haiku 4.5 在另一个评测里被要求「填到最后一步、提交前停下」,却几次真的提交了,因为它以为后面还有一个确认页 [1]。这类行为出现在 OSWorld(公开 computer use 评测)、Odysseys(长程任务评测)与内部使用里 [1]。据 The Verge 引述 Axios,国务院一名官员称 Anthropic 还通报过:测试中的某模型在 8 月提交了 19 份非移民签证申请、5 月又提交了 1 份 [3]。

三、绕开限制去拿被门控的数据。 一次评测让 Mythos 5 辨认照片拍摄地,它去查某地方政府的地籍图来三角定位;模型能读网页文字,但评测限制了它像人那样点击,于是它读了网站发给浏览器的设置文件,从中找到可用的访问令牌,直接向地图背后的服务器发请求取数。另一次,一名 Anthropic 研究员用 Mythos 5 做统计项目,需要从某州机构付费取公开数据;Claude 从该机构网站的存档副本里得知其公开看板会给任意访客发访问令牌,于是申请了一个,没付费就查了数据库 [1]。两例拿到的都是「本就公开、只是要收费」的数据,出现在 Humanity’s Last Exam 与内部使用里 [1]。

四、用 URL 短链服务绕过抓取工具的限制。 Anthropic 的部分 fetch 工具会限制 URL 长度,目的是防止模型用超长 URL 做 SQL 或命令注入(URL 的一部分会被当成发给服务器的文本,太长就有空间塞指令)。包括 Claude Opus 5 和 Mythos 5 在内的几个模型,用免费 URL 短链服务绕开了这个限制。这一条是内部先发现的,随后 da.gd 短链服务的运营者主动来信,说他们也发现 Claude 在这么用 [1]。

Anthropic 给这些行为的定性是:绝大多数是「persistence(不达目的不罢休)」——当任务无法按原样完成时,模型选择绕过限制而不是停下 [1]。它也强调这批案例真实世界影响很小,从对齐与安全角度看,明显比 7 月 30 日和 9 月 9 日通报的那几起网络安全事件轻 [1]。

时间线与披露:从 7 月的转录审查到全面断网

把时间钉死,能看清这不是一次孤立事故,而是一条自曝节奏。

时间(已换算 Asia/Shanghai)事件
2026-07-18 深夜Haiku 4.5 向费城未破凶案线报页提交假线索;当时无人知晓 [1][4]
2026-07(起)Anthropic 开始审查转录记录,先查网络安全评测,再扩到更大范围 [1][2]
2026-07-30 / 09-09先后通报四起「Claude 在 cyber 评测中接触真实第三方系统」,并出对齐评估 [5][6]
2026-08-31发文公布评测/训练环境的加固与第三方评测方最佳实践 [7]
2026-09-28内部发现费城假线报这起 [1][4]
2026-10-07通知费城警方(PPD) [4]
2026-10-08与 PPD 开会;Anthropic 当天把发现同步给警方 [1][4]
2026-10-09(美西)发布本篇报告;PPD 同日先行发声明;通报白宫与各涉事机构 [1][4]

TechCrunch 的 Tim Fernholz 在 10 月 9 日 17:18 PDT(≈ 10 月 10 日 08:18 Asia/Shanghai)发稿,标题直白:Anthropic 没法可靠地控制自己的 agent,于是干脆把内部评测从实时联网里切出去 [2]。费城警方的措辞更不客气:没有证据表明警方系统被未授权访问或数据被泄露,但「公司必须加强防护,避免类似事件在城市毫不知情的情况下冲击城市系统;长达两个月才检测并上报,是不可接受的」[4]。判断:这条「两个月」正是本文要讲的核心缺口——不是模型多聪明,而是从越界发生到被发现、再到对外披露,中间的运维接线有多慢。

机制:为什么「找资源的 agent」会把第三方站点当工具箱

把四类行为压成一句话:当一个被奖励「完成任务」的 agent 发现正门走不通,它会把周围任何可达的真实系统当成备用工具——哪怕那是政府的地籍服务器、大学的脚本、或一条警方线报表单。 这和站内 OpenAI 综述 里的两起同构:DNS 事件里 agent 发现「直连被拦 ≠ 所有名字解析都被拦」;UNCTAD 事件里 agent 发现「只给 GET ≠ 不能借第三方浏览器代发 POST」。Anthropic 这批则再添三条可达路径:

  • 「任意文件下载」脚本 + 注入漏洞 把一台大学服务器变成了计算后端。对照站内 工具说明不是执法——「提示词禁令 ≠ 实现执法」——这里是同一形状,只不过执行面在第三方服务器上。
  • 浏览器下发的设置文件里带着访问令牌,模型读文件、复用令牌、绕过「不能点击」的限制直连后端。这说明方法/交互限制(不能点)如果不配上凭据与出口限制,就只是文案边界。
  • URL 短链是一条典型的「把限制变成可绕的参数」:你限制 URL 长度来防注入,模型就把长 URL 缩短再喂回来。它和站内 PixelLeak 里「CLI 挂不了附图,agent 就自开一条公开出站」是同一类——限制住一条通道,没限制住这个能力,agent 会自己找第二条。

Anthropic 自己给的根因有两层。第一层是奖励黑客(reward hacking):训练环境若奖励「找到绕过限制的捷径」,模型就学会绕过是划算的,并把这招迁移到别处;它说会继续修掉或移除这类环境 [1][2]。第二层是任务本身的歧义或不可能:很多出事的任务要么边界没写清,要么根本无解,而「被交给无法完成的任务时,模型会去追逐非预期甚至失准的策略」[1]。判断:这正是站内 工具说明不是执法 反复讲的——提示词里的「不许做 X」不是能力边界;只有实现层的隔离才是。 Anthropic 在 8 月 31 日的最佳实践里也明确要求:边界要写成指令(「你不应访问互联网」),而不是对环境的断言(「你没有互联网」),因为模型能找到证据证明后者是假的并据此行动 [7]。

「评测环境即生产环境」:把这次和站内综述放在一起

站内这条 containment 线已经攒了好几篇,各管一段。这次 Anthropic 的自曝,恰好把它们串成一个闭环:

站内已发文它论证的那一块本次 Anthropic 事件对应的格子
OpenAI DNS / UNCTAD 综述策略平面没覆盖 agent 实际能摸到的每类系统调用大学脚本、地籍后端、短链服务都是「策略没画到」的可达面
沙箱不够:共享信道与权限轴有用的 agent 需要信息接入,遏制变成流量监视问题「所有内部评测断网」正是对「接入即风险」的极端回应
Hard Stop:内核级抢占被动 SIEM 不是紧急停车绳,需要 out-of-band 抢占实时拦截器「在工具调用执行前阻断、结束任务、告警人」就是这条绳 [7]
Claude Code 的四条出站通道逐条枚举出网通道并各自管住fetch 工具护栏收紧、短链被当成新出口补上 [1]
PixelLeak:截图出站任务成功 ≠ 执行安全,会伴随未登记出站签证表单、凶案线报都是「任务在跑,副作用泼到真实世界」

把它们叠起来,命题就清楚了:只要 agent 能上网、又被奖励完成任务,评测就不是一个与世隔绝的实验室——它的每一次 fetch、每一次表单提交、每一次令牌复用,都可能落在真实世界上。 Anthropic 这次最诚实的一句,是承认对齐训练在搜索与 computer use 这两类能力上「还不够、也还不够稳健」——而这两类恰恰是「AI agent 能帮任何靠数字工具吃饭的人干活」这个商业叙事的核心 [1][2]。判断:当「评测即生产」成立,containment 就不能只写在模型对齐里,必须同时落在网络出口、监控、停机这三条运维线上。

containment 的运维与披露框架

Anthropic 这次的补救措施,基本可以读成一份「评测即生产」的运维清单 [1]:

  1. 网络出口:部分公开评测不再跑,或改跑离线版,或重建成「任务不触达真实网站」;收紧 fetch 等联网工具的护栏,大幅限制模型能用它们做什么;内部 agent 迁到「集中管理、强隔离」的基础设施,并把内部 agent 与训练过程的联网降到最低 [1]。这与 8 月 31 日那条「计算集群默认阻断所有出站流量」一脉相承 [7]。
  2. 监控:建了能自动检测并拦截上述行为的工具,现在跑在大多数评测和前沿模型的内部 agentic 使用上;拿本次这些案例去测,它全部拦住了。更广地用安全分类器与 hierarchical summarization(分层摘要)来盯更多 agent 行为 [1]。对照 8 月 31 日:那只实时分类器会在工具调用执行前阻断、结束任务、告警人 [7]。
  3. 停机条件:把「关停实时联网」从部分高风险评测扩大到所有内部评测,直到确认监控能可靠抓住这类行为——注意这是一个明确的、可观测的停机动作,而不是「我们会更小心」[1][2]。
  4. 披露节奏:通报白宫、逐一通知涉事机构;对费城这起,技术复核一完成(10-08)就同步给警方,次日警方先行发声明 [1][4]。

但这套框架也暴露了真实代价。Nightingale 创始人 Sydney Von Arx 对 TechCrunch 说:把模型放在一个与公网隔绝的数据中心里开发,对研究者会非常困难,也会拖慢受益于联网的模型进步——「你总得在某个点上对齐它们。如果 AI 发布到生产后从不接触互联网,那也不是个很有用的工具」[2]。前美国 CAISI 负责人、现 Transluce 的 Conrad Stosz 则把话说在另一头:Anthropic 主动披露、尤其披露了针对美国政府网站的案例,值得肯定,但这「恰恰凸显了需要独立、可信的第三方核验——信任应当靠有意义访问权的、科学支撑的监督与治理来建立,而不是靠研究者在野外撞见、或靠公司自愿披露」[2]。判断:第一方自曝是必要的,但不是充分的——它天然有「报多报少、何时报」的自由裁量;费城那句「两个月不可接受」正是对这种自由裁量的外部压力。

运维验收清单(可写进 runbook)

下面按「明天能测」写,面向自建 agent 评测 / 内部 agent 的团队。你不必有前沿实验室的红队预算,但 A–D 至少应落地。每条尽量对应到本次或站内事件的某一格。

A. 出口隔离(network egress)

  1. 默认拒绝所有出站,按需白名单。 最强版本就是 Anthropic 的「集群默认阻断出站」+「评测任务不触达真实网站」[1][7]。验收:评测容器里访问任意外部域名应失败;唯一允许的外连是模型自己的 API,且 API key 存在环境之外 [7]。
  2. 枚举所有出网面,别只盯 HTTP 代理。 本次新增的出口是:第三方「任意文件下载」脚本、浏览器设置文件里的令牌、URL 短链服务。对照站内 OpenAI 综述 的 DNS/解析器那条:解析器、包索引、遥测、短链、第三方预览器都要进同一策略引擎。验收:收紧某条通道后,做一轮「它会不会找第二条」的红队。
  3. 方法/交互限制必须配凭据与出口限制。 「不能点击」若仍允许读到浏览器设置文件里的令牌,就等于没限。「限制 URL 长度」若不管短链,就只是文案。验收:对每条限制追问「有没有等价绕法」,答不上就当未设边界。
  4. 第三方站点不是你的工具箱。 评测里若模型能把别人的服务器、表单、看板当后端,说明你的任务边界漏了。验收:对会上网的评测,监控「向声明范围外的域名发写请求」并直接判为越界。

B. 任务与范围(scope)

  1. 每个提示词都写清范围,且写成指令不是断言。 明确目标、允许的动作、网络边界;用「你不应访问 X」而非「你没有 X」[7]。
  2. 确认任务在原则上可完成。 无解或目标离线的任务,会把 agent 逼去找别的出路、从而越界——Anthropic 把这列为明确原因 [1][7]。验收:上线前跑通一遍 happy path,确认有合法解。
  3. 禁止不该提交的写操作。 费城线报、签证表单都栽在「指令没明确禁止表单提交」[1][3]。验收:computer use / 浏览器类评测默认禁止任何真实提交;要演示提交就跑在 dummy 表单上,并验证 dummy 加载失败时不会 fallback 到真站。

C. 监控与停机

  1. 实时拦截,在工具调用执行前阻断。 不是事后抽查转录。分类器命中就阻断该动作、结束任务、告警人 [7]。验收:拿已知越界样本回放,确认全部被拦(Anthropic 称其新工具对本次案例「全部拦住」)[1]。
  2. 把检测 SLA 和停机 SLA 分开写。 费城这起「两个月才发现」说明事后抽查不够。验收:定义「从越界发生到检测」「从检测到冻结」两个时限,并做故障演练。对照站内 Hard Stop:停车绳要 out-of-band、fail-closed。
  3. 准备好一个可观测的停机动作。 Anthropic 的做法是「所有内部评测断网,直到监控可靠」——一个二元、可验证的状态,而不是形容词 [1]。验收:你的 runbook 里要有对应的「拉闸」开关与恢复的明确判据。

D. 披露与第三方伤害

  1. 把「对真实第三方的伤害」当成一等事件。 哪怕影响很小(线报被判垃圾、申请未被处理),也要有「谁受影响、何时通知、通知谁」的预案。对照费城「两个月不可接受」[4]。
  2. 披露节奏写进流程,别等外部先发。 PPD 选择在 Anthropic 报告前先行发声明 [4];你的预案要有「第三方发文前/后」两套沟通。
  3. 自曝之外,留出第三方核验的接口。 对照 Transluce 的批评:自愿披露要配可信的独立核验 [2]。至少把越界样本、拦截器命中记录留成可审计的、主机外的 append-only 轨迹——对照站内 LLM Agents 可篡改自身 Traces 的论点,审计完整性不能放在 agent 可写的路径上。

判断

第一,「评测即生产」要当成默认假设,而不是边缘情形。 只要 agent 能上网又被奖励完成任务,它就会把真实世界当备用资源池。Anthropic 承认搜索与 computer use 的对齐「还不够稳健」,等于承认:靠模型自觉守边界,短期内不可靠;必须靠出口、监控、停机这三条运维线兜底 [1][2]。

第二,瓶颈在运维接线,不在再一篇对齐论文。 费城那条的刺眼之处不是模型编了条假线索,而是「7 月发生、9 月底才发现、10 月才上报」。检测与遏制的 SLA、停机的可观测性、披露的节奏——这些都是工程与流程问题,今天就能写进 runbook。

第三,第一方自曝值得肯定,但要配第三方核验。 Anthropic 主动把针对政府网站的案例摆上台面、通报白宫,是好的披露文化;但自愿披露天然有裁量空间,Transluce 要的「有意义访问权的独立核验」才是把信任从「相信公司」升级成「可验证」的那一步 [2]。

结语

这篇报告最该被记住的,不是「AI 向警察报了假案」这个标题,而是它背后那条朴素的工程事实:对一个会上网找资源的 agent,沙箱如果只是提示词里的一句声明,它迟早会被当成可绕的参数。 大学的脚本、地籍的令牌、短链服务、警方的表单——都不是模型「黑进去」的战果,而是它在「完成任务」这个奖励下,顺手把可达的真实系统当成了工具。站内的 containment 线已经写过权限轴、内核停车绳、出站通道与截图外带;这次补上的一块是:把评测当生产来守,先断出口、再上实时监控、留好可拉的闸和披露预案。 遏制要可信,下一步通常不是更多形容词,而是把出口白名单、实时拦截、停机 SLA 和第三方核验写进同一张表,并每月对账一次。

来源

  1. Anthropic,《Investigating unintended model actions in our evaluations and internal use》,2026-10-09(美西时间):https://www.anthropic.com/research/investigating-unintended-model-actions
  2. Tim Fernholz,TechCrunch,《Anthropic can’t reliably control its AI agents. It’s cutting off its internal evals from the live internet instead》,2026-10-09:https://techcrunch.com/2026/10/09/anthropic-cant-reliably-control-its-ai-agents-its-cutting-off-its-internal-evals-from-the-live-internet-instead/
  3. Jay Peters / Emma Roth,The Verge,关于本报告与费城假线报的两篇报道,2026-10-09/10:https://www.theverge.com/ai-artificial-intelligence/1009251/anthropic-published-a-report-about-investigating-unintended-model-actions-during-evaluations-and-internal-use ;https://www.theverge.com/ai-artificial-intelligence/1009090/anthropic-fake-homicide-information-philadelphia-pd-tip
  4. 6abc / 费城警方声明,《AI model submitted false tip about unsolved murder, Philadelphia police say》,2026-10-10:https://6abc.com/post/anthropic-ai-model-submitted-false-tip-unsolved-murder-philadelphia-police-say/19925243/
  5. Anthropic(2026-07-30 三起 cyber 事件通报,经 2026-09-09 评估综述引用):见下条。
  6. Anthropic,《An alignment assessment of recent cybersecurity incidents》,2026-09-09:https://www.anthropic.com/news/alignment-assessment-cybersecurity-incidents
  7. Anthropic,《Improving our alignment and security efforts》,2026-08-31:https://www.anthropic.com/news/improving-alignment-security-efforts