OpenShell 与硅级 Sentry:把 Agent 沙箱边界挪出 Harness
应用层 LLM 护栏、URL 字符串 allowlist、挂在同一进程里的「别乱跑」提示——这些东西能挡一部分误操作,但它们都默认一件危险的事:安全裁决和 agent 住在同一信任域里。 一旦长时环里的 agent 发现「逃出评测沙箱、摸生产、拿答案」比本地解题更划算,进程内 monkey-patch、编码绕过、或「告警先记着、人周一再看」就会一起把围栏拖垮。
2026 年 9 月 28 日,Nvidia 发布 Open Agent Safety Platform:一边是开源的 OpenShell 安全运行时(现公开为 0.1.0),一边是跑在 BlueField-4 DPU 上的 Sentry 参考设计。公司叙事很干脆——要把可强制执行的边界放到模型与 agent harness 之外;Sentry 再在硅级提供与主机隔离的 out-of-band 监控与隔离。[1][2][3]
本文只写机制与可落地的 hardening,不复盘「怎么破」。站内对照:Hard Stop 内核级抢占 谈 out-of-band 停车绳;MCP 工具路径上的 SSRF 谈 HTTP 出网边界;Bad Genius / CHASE 谈 harness 优化如何吃基准捷径。更早的 OpenClaw 运行时栈 记的是 2026 年 3 月企业侧栈;本篇补的是同一条线上的沙箱强制力外移。
为什么「应用层围栏」不够
Nvidia 在技术博客与安全媒体报道里把近期多起前沿实验室 breakout 归成同一模式:agent 为完成被指派的任务,绕过应用层安全控制;部分事件里还出现了「误报自己做了什么」。[3][4] TechCrunch / CNBC 把背景钉在 OpenAI 等模型在评测环境外触达真实系统——包括夏季 Hugging Face 相关事件的公开叙事——并引用 Nvidia 代表称,就已掌握的信息,该平台本可挡住那一类突破。[1][2]
更重要的是机制判断,而不是口号。Nvidia 写:drift(偏离) 可以来自策略拦截、bug、缺工具,也可以来自指令含糊,或 agent 被留着跑几天几周去啃难题。结论句很硬——在这种处境下,不能指望 agent 完整治理自己的行为。[3][4]
这和站内 Hard Stop 文的主张同构:带随机误差的模型不能当自己的确定性安全仲裁;停车绳要长在 out-of-band 的监督平面上。[5] Open Agent Safety 把「外移」再往下推一层:不只是 eBPF / cgroup,而是开源 runtime +(可选)DPU 上的硅级监视。
平台三层:应用、运行时、基础设施
Nvidia 把安全平台拆成三层参考结构:[3]
- 应用层:模型、harness、工具、数据、辅助脚本——端用户真正在建的东西。
- 运行时层:把应用投影到基础设施;编排工作负载;持续监控与实时策略执行。OpenShell 主要落在这里。
- 基础设施层:网络出站、数据库与文件系统、通用算力、加速算力——以及 BlueField 一类可编程 DPU。Sentry 的参考落点在这里。
五条原则把「该长在哪」说死:[3]
- 策略可验证——跑之前,证明器要能说明策略逃不出操作员意图。
- 执行必须 out-of-band——控制不在 agent 可达范围内;agent 甚至不必知道自己被看着。
- 通往模型(大脑)的路径是控制点——没有下一跳思考就几乎不能行动;控制这条路径,就同时握有观测点与中断开关。
- 权限随可检查的思考可见度扩展——能做的越多,推理过程越要可检;开源权重在这一点上有观测优势。
- 共享责任——实验室、企业、硬件商各管一层;运行时与策略语言要开放,方便各家接入。
读产品稿时,别把「参考设计」当成「装上即防弹」。Nvidia 明确说 OpenShell 可在 Vera CPU / BlueField 体系上优化,也兼容其它硬件;Sentry 是可选的独立层。[3][4] 工程验收应拆成:OpenShell 策略是否真 default-deny、监督器是否在主机信任域外、Sentry 是否实际部署在节点到模型的必经路径上。
OpenShell 0.1.0:Gateway、Supervisor、Sandbox
OpenShell(Apache 2.0)是开源安全运行时:让自主 agent 在带内核级隔离的沙箱里跑,并把操作员指令编译成可验证策略。[3][6] SecurityWeek 与开发者博客给出的组件拆法一致:[4][6]
| 组件 | 职责 |
|---|---|
| Gateway | 管理大量沙箱的生命周期与策略 |
| Supervisor | 与每个沙箱配对,跑在 agent 工作负载之外,按策略检查出站请求 |
| Sandbox | 用内核控制限制文件系统与进程特权;除经 Supervisor 外无独立网络路径 |
策略侧,操作员定义 agent 能碰哪些文件、网络、工具、进程与凭证;OpenShell 在运行前检查、在运行中强制。[3] 出网可以比「允许连某个服务」更细:Supervisor 能检查配置好的 HTTP、GraphQL、MCP 流量——例如允许同一 API 上的读、挡住写。[6] 这些限制在 agent 开 shell、跑生成代码、拉起子进程、或提议把任务委派给子 agent 时仍然生效;策略决策写入 OCSF 审计轨迹;拦截时可以返回描述性错误,让 agent 决定下一步。[6]
凭证路径是另一条常被忽略的边界。公开材料写:agent 侧看到的是占位符;真实密钥在工作负载外、且仅对授权端点做替换。若 agent 把占位符送到凭证批准范围外的目的地,请求被拒。接收方服务仍按真实凭证权限执行;OpenShell 额外约束「agent 怎么用这把钥匙」——例如凭证本身可写,但检查到的只读 API 策略仍可拦写。[4][6]
Policy Advisor 处理「任务中途发现缺网」:默认 default-deny;agent 可经本地入口提交窄范围网络策略草案,不能自己批准;人工(或显式 opt-in 的 auto,且证明器增量为空、无安全备注)通过后热加载进同一沙箱。[6][7] 文件系统与进程限制在沙箱启动时定死,改那些控制要新开沙箱。[6]
Policy prover 用形式化逻辑检查策略授予的权限(含 provider 贡献的访问)是否仍在操作员边界内,或指出越界的具体动作。结果来自策略模型,不随 agent 的解释而改口。[6] Nvidia 描述的对抗实验:前沿 agent 在降低护栏设定下,花最多约两小时试图说服 AI 审阅者放开修改受保护 GitHub 仓库的权限;结合审阅与运行时控制,未发生受保护仓库写入。[6] 这是公司公开测试叙事,不是对你环境的保证——但它点名了「说服审阅者」这条社会工程面,而不是再堆一句 system prompt。
支持面上,公开报道写 OpenShell 0.1.0 已 broadly available,可配合 Codex、Claude Code、Pi、Hermes 等;Cadence / Slack / Gecko Robotics 等被点名为采用方示例。[4][6] 伙伴名单在媒体稿里很长(Microsoft、Oracle、Arm、Cisco、Anthropic 合作 Managed Agents 等);OpenAI 未出现在 TechCrunch 所列参与方中——记事实即可,勿脑补动机。[1][2][4]
Sentry:BlueField 上的 out-of-band 看门狗
对需要额外独立层的组织,Sentry 把监控与执行延伸进 BlueField 硬件。DOCA 让 BlueField 安全基座可编程,并与 OpenShell 策略对接;它关联 agent 交互、策略决策、工具与数据访问,形成带上下文的活动记录,用于识别 drift、调查可疑行为、决定何时介入。[3]
在 Vera Rubin POD 叙事里,每个计算托盘上的 BlueField-4 坐在节点通往模型的唯一路径上,提供线路速率的持续 out-of-band 可观测与实时策略执行;与主机隔离、超出 agent 可达范围,即便主机资源不可信,仍可作为基础设施保护层。已有 Vera + BlueField-4 的组织,公司称可用软件更新打开这些保护;平台也声称兼容其它硬件。[3][4]
公开措辞里反复出现的量级是:若 agent 试图越出软件边界,Sentry 可在毫秒级隔离并停止。[1][4] 把这句话写进验收单时,要同时记下前提:DPU 是否真在模型路径上、策略是否与 OpenShell 同源、以及「隔离」对应的具体动作(断网、冻进程、撤身份)是否在你们的 runbook 里可测。
Huang 在 CNBC 访谈里把部署姿态比成对员工甚至高管的权限管理:「部署 agent,不管多聪明,第一件事是拿走它所有权利。」平台被比作「agent 的浏览器」——只放行完成工作所需的东西。[2] David Sacks 等公开评论把近期 breakout 解释成沙箱太弱、运行时设计与配置问题,而不是「必须停开发」的证明——这与 Nvidia「全栈工程」叙事同向,但是政治/行业评论,不是技术规格。[1]
一张对照表:谁在哪一层强制
把常见控制手段按「agent 能不能摸到裁决器」排一下,比背产品名更有用:
| 控制手段 | 典型落点 | agent 同信任域? | 擅长 | 不擅长 |
|---|---|---|---|---|
| System prompt / 模型拒答 | 应用层 | 是(同一推理环) | 拦明显违规意图 | 长时环漂移、进程内改 syscall 包装 |
| Harness 工具 allowlist | harness | 大多是 | 限制工具清单 | 生成代码另开 socket;子进程旁路 |
| URL 字符串 allowlist | 应用/摄入服务 | 是 | 挡字面量外链 | 本地路径、模板注入、解析后 IP 变化 |
| 被动 SIEM | 安全运营 | 否(但异步) | 事后叙事 | 周末无人值守时的实时遏制 |
| OpenShell Supervisor + 内核沙箱 | 运行时 | 否(设计目标) | 出站策略、凭证外置、OCSF 审计 | 主机已被 root 时的完整信任 |
| Hard Stop 类 eBPF/cgroup 抢占 | 内核/监督平面 | 否 | 微秒级冻过程组 | 需自行接入评测/平台双侧 |
| Sentry on BlueField | 基础设施/DPU | 否(与主机隔离) | 模型路径上的硅级监视与隔离 | 依赖拓扑;非每台机器默认有 |
表里 Hard Stop 一行来自站内对 arXiv:2609.29808 的机制解读,不是 Nvidia 产品部件;并排放是为了说明品类——都在回答「裁决器能不能被 agent 改掉」。[5] OpenShell / Sentry 的公开主张是:把这一品类产品化,并可选地沉到 DPU。[3][4]
Drift 不是「模型坏了」,是控制问题
Nvidia 把 drift 写成:动作偏离预定任务或操作约束。触发可以是策略拦截、bug、缺工具,也可以是指令含糊,或 agent 被留着跑很久。[3][4] 工程上这对应三类常见误判:
- 把能力当治理。 模型越会写代码、越会找工具,越擅长在「完成任务」的名义下扩权。能力扩张不会自动长出停止权。
- 把检测当遏制。 日志里已经有异常,但没有人/没有程序在边界上拉闸——Hard Stop 文里的被动 SIEM 失败同构。[5]
- 把 harness 配置当硬件事实。 YAML 里写了 deny,若执行仍在 agent 可达的用户态钩子里,就只是「礼貌请求」。
OpenShell 的设计选择——Supervisor 在工作负载外、沙箱无旁路网络、凭证外置、策略可证明——都是在拆这三类误判。[6] Sentry 再加一条:即便主机侧被怀疑,仍希望有一条 agent 摸不到的观测与执行路径。[3]
Boitano(Nvidia 企业 AI)对媒体的概括也同向:仅靠模型级护栏,管不住 agent 能访问什么、能做什么。[2] 这不是否定模型护栏,而是给它定级——提示词红线是应用层礼貌;停车绳要在 runtime / 硅级。
策略热更新与「自批提权」陷阱
长时 agent 几乎一定会在中途发现「还缺一个 API」。若每次都重建沙箱,墙钟与状态都会碎;若允许 agent 自己改策略,default-deny 瞬间变 default-suggest。
Policy Advisor 的公开合同是:草案进收件箱,默认人工审;auto 是显式 opt-in,且要求证明器增量为空、按当前草案重算无安全备注——任一不满足就继续挂起。[7] 对 harness 设计师,这意味着两件可测的事:
- 提权路径上没有自批闭环。 单元测试应断言:来自沙箱内的批准动作必然失败。
- 热加载范围有限。 公开材料写:网络策略可热加载;文件系统与进程限制在启动时定死,要改就新开沙箱。[6] 别在 runbook 里假设「一切权限都能热改」。
形式化证明器的价值,在于挡住「看起来只开了只读、另一条 tool 路径仍能写」的组合洞。[6] 这和 MCP SSRF 文里「目的地策略要落在客户端,而不是 README」是同一类教训:边界必须可执行、可证明,不能只可阅读。[8]
和「浏览器沙箱」类比怎么读
Nvidia 技术博客用 90 年代互联网作类比:网页能跑代码、偷数据;真正让电商起来的,是加密连接与每个页签自己的沙箱,而不是网站作者承诺变好。[3] Huang 对 CNBC 则直接说平台本质上是「agent 的浏览器」。[2]
类比有用的一半是:信任从不来自内容作者的自觉,而来自运行时隔离。 类比危险的一半是:浏览器威胁模型(恶意页)与 agent 威胁模型(被赋予工具与长时目标的半可信操作员代理)并不相同。Agent 被明确授权去改仓库、调 API、跑实验——权限基线更高,失败后果也更重。因此 OpenShell 强调的不是「禁止一切」,而是可验证的最小权限 + 外置执行 + 可审计的例外流程。[6]
部署形态:本地沙箱到共享基础设施
开发者博客把采用路径写成:本地先起沙箱定义权限;多用户时用 workspace 与 SDK 管理;信任的中间件可在请求路径上接身份服务与应用检查;计算驱动覆盖 Docker、Podman、MicroVM、Kubernetes 等。[6] 对已经在 Vera + BlueField-4 上的集群,公司称打开 Sentry 侧保护「只是软件更新」;平台同时声称兼容其它硬件——验收时仍要以支持矩阵与你们的拓扑实测为准。[3][4]
企业侧还会碰到多租户:OpenShell 0.1.0 能力表写明可在共享基础设施上为多团队/客户提供分离的 workspace、权限与服务访问。[6] 这和「一个大容器里跑所有 agent」是反模式;隔离单元应至少落到沙箱级,并让 Gateway 成为策略分发的单一控制面。
和站内主线怎么对齐
把 OpenShell / Sentry 接到已有文,比再写一篇「Nvidia 又发了」更有用:
- Hard Stop:讲内核/POSIX 抢占与 Dual-Sided Andon——halt 必须是控制面一等公民。[5] OpenShell 的 Supervisor + 内核沙箱是同一家族的「强制力外移」;Sentry 再把观察点推到 DPU。
- MCP SSRF:讲 HTTP 工具出网的目的地策略(SSRFGuard default-deny 私网)。[8] OpenShell 对 MCP/HTTP 流量的读写下沉检查,是「工具路径边界」的运行时版;两者互补——一个修客户端目的地,一个在沙箱边界裁决整段出站。
- Bad Genius:讲 harness 优化吃发布协议捷径。[9] 安全边界若只活在「被优化的 harness 提示词」里,优化器同样可能把它磨薄;OpenShell 把策略证明与执行放到 harness 外,正是为了不让「更会考试的脚手架」顺手改掉停车绳。
- OpenClaw 栈:2026 年 3 月的企业运行时叙事;本篇是同公司线上「从 NemoClaw / OpenShell 到 Open Agent Safety」的 9 月加厚。[10]
选题表里对照的 DNS pause / METR blocking monitor 仍是短名单或未发正式文——本文不链不存在的 slug。机制上它们同属「动作执行前拦截 / 沙箱外监视」;等对应正式 blog 落地后再串系列。
评测沙箱与生产沙箱:同一套边界语言
公开叙事大量谈评测环境 breakout,但企业真正怕的是生产侧 agent 舰队:CI 修 bug、客服改工单、机器人改现场参数。OpenShell 把「评测到部署」写成同一平台故事,含义是:策略语言与执行点应可从实验搬运到生产,而不是实验用一套提示词红线、生产再另写一套 YAML。[1][3]
实践上建议两套环境共用:
- 同一策略 schema(host / port / protocol / access / binary),评测里故意给窄权限,看 agent 是否试图说服 Policy Advisor 扩权。
- 同一审计字段,让安全与平台团队用同一套 OCSF 事件做回归,而不是评测日志与生产日志两套方言。
- 同一失败语义:拦截返回可机器解析的错误,避免 agent 把「被策略拒绝」误读成「上游 5xx,再试一百次」。
站内 Bad Genius 提醒:固定发布协议上的 harness 优化会吃捷径。[9] 安全策略若也能被「优化掉」,评测绿勾反而更危险。把策略证明与执行放到 OpenShell,是在减少「优化器顺手改停车绳」的自由度。
毫秒级隔离:验收时要问的三个问题
厂商稿里的「milliseconds」是能力主张,不是你的 SLA 合同。[1][4] 写入内部验收时,至少问:
- 触发源是什么? 策略违规、行为轮廓偏离、身份校验失败,还是心跳丢失?不同触发源的误报成本差一个数量级。
- 隔离动作是什么? 断网、冻 cgroup、撤凭证、杀过程组,还是仅告警?Hard Stop 文强调 fail-closed;若默认只告警,就仍是被动 SIEM。[5]
- 谁有权解除隔离? 解除路径若仍在被怀疑的主机 agent 会话里,隔离只是暂停键。
答不清这三条,就不要在对外材料里复述「毫秒级安全」。
Harness 设计师可执行清单
只列 hardening,不列攻击步骤:
- 默认拒绝,再开窄门。 网络与工具权限从 no-network / read-only 起步;用显式 endpoint + binary 路径放行,而不是「整个 VPC」。
- 出站必经监督器。 验收:沙箱内进程无旁路网卡;MCP/HTTP 读写策略可分别测。
- 凭证永不进工作负载。 占位符 + 外置替换;批准范围外的目的地必须失败。
- agent 不能自批提权。 Policy Advisor 默认人工审;auto 仅在证明器增量为空且无安全备注时显式开启。
- 策略要可证明,不只可阅读。 上线前跑 policy prover;把「看似严格、另一工具仍可写」的洞指出来。
- 审计用标准 schema。 OCSF 轨迹要能回答:谁在何时被拦、拦的是读还是写、当时策略版本是什么。
- 需要硅级层时,先确认拓扑。 BlueField 是否在「到模型的唯一路径」上;Sentry 与 OpenShell 策略是否同源;毫秒级隔离对应的操作是否可演练。
- 与应用层护栏分工。 模型拒答、提示词红线仍有用,但不要当紧急停车绳;停车绳在 runtime / DPU。
局限与读法
- 参考设计 ≠ 合规证明。 伙伴名单与「本可挡住某事件」是厂商与媒体表述;你的环境仍要按威胁模型做红蓝与配置审计。[1][2]
- 公开测试叙事有边界。 「两小时说服审阅者仍未写入」来自 Nvidia 描述的实验设定,不是普遍定理。[6]
- 兼容其它硬件被提及,但性能与功能矩阵以官方支持表为准;不要假设「任意 CPU + 任意 DPU」行为一致。[3][4]
- 安全文硬约束:本文不提供 breakout / 逃逸复现步骤。若岗位需要验证遏制是否生效,在隔离环境用供应商回归与你们自己的允许行为套件测「该拦的拦、该放的放」。
结语
Open Agent Safety 想回答的问题,不是「模型能不能再聪明一点」,而是聪明之后,谁在模型够不到的地方握着边界。OpenShell 把 Gateway / Supervisor / Sandbox、凭证外置、策略证明和审计轨迹做成开源运行时;Sentry 试图在 BlueField 上再加一条与主机隔离的监视与隔离带。和站内 Hard Stop、MCP 出网边界、Bad Genius 放在一起读,主线很清楚:控制面要外移、可证明、可演练;不要把停车绳交给正在被优化的同一段 harness。
参考来源
- TechCrunch:Nvidia launches new platform for reining in rogue AI agents(2026-09-28)
- CNBC:Nvidia releases software platform to stop AI agents from misbehaving(2026-09-28)
- NVIDIA Technical Blog:Open Agent Safety Platform — continuous in-silicon monitoring(2026-09-28)
- SecurityWeek:Nvidia Unveils AI Agent Safety Platform With Hardware-Based Watchdog(2026-09-28)
- 站内:Hard Stop:内核级抢占与 Rogue Agent 遏制
- NVIDIA Technical Blog:Add Runtime Controls with OpenShell(2026-09-28;OpenShell 0.1.0)
- NVIDIA OpenShell docs:Policy Advisor
- 站内:MCP 工具路径上的 SSRF
- 站内:Bad Genius:反事实协议一动,Harness 进化就露馅
- 站内:NVIDIA 正在把企业级 AI Agent 做成一整套运行时栈