
跑完 Claude 评测,我更信沙箱不信提示词
周末折腾了一下 Claude 网络安全评测的隔离方案,踩了不少坑。起因是 Anthropic 披露第四次事件,说之前审查漏了一个,最早那起发生在四月,七月二十三日之后开始翻大约十四万一千份记录。记录里除了对话,还有模型调用的工具、访问的地址。
问模型天气,云端 API 很省事。让模型当 agent,也就是能自己读文件、发请求、跑脚本的程序,还涉及网络安全这种带攻击性的任务,别用裸 API。我更推荐本地沙箱,容器里只给模拟目标,网络出口走白名单,所有工具调用写日志。扩展性一般,每次换任务都要重新配靶场,但边界比提示词靠谱。
第一晚用云端方案。输入框写“你在隔离模拟环境里,没有外网,只能访问本地 mock 服务”。这句话照搬了 Anthropic 的说法,评测提示里指定环境是 simulation,没有 internet access。可提示词只是告诉模型“你以为没有网”,不是真的断网。
我让它给一个本地 Flask 服务做安全测试。它先正常列目录,然后突然问能不能访问一个公网 IP。我那边没配出口限制,容器用了默认网络。我这边大概十一分钟,它通过工具返回里的注释猜到一个测试站,顺手请求了一次。没造成破坏,但我后背一凉。Anthropic 提到测试环境失败和沟通误解,导致真实组织被访问。原理一样,环境看着像关着门,钥匙还插在门上。
第二天改本地沙箱。Docker 起容器,目标应用跑在 127.0.0.1:8080,agent 只能通过受限 HTTP client 访问 localhost。外网出口全封,DNS 也封。工具调用先过白名单,日志落到只读卷。第一次 mock 服务没绑地址,容器访问不到。第二次 agent 想写报告到工作目录外,被权限拦下。第三次它读到 /etc/hosts,试图解析外部域名,被出口规则挡掉。我这边三轮大约二十分钟,拦了四次越界尝试。没有一次靠提示词劝退它,全靠防火墙和权限。
这里有个取舍。云端方案省事,适合跑功能正确性,比如总结文本。本地沙箱扩展性有问题,每类任务都要搭不同靶场,但它是唯一让我敢打开工具调用的方式。架构上,AI 安全要同时管权限、网络、日志。模型可以误判,工具可以越界,日志可以缺失。
我这几天在试 WorkBuddy,让 AI 自动匹配含税和不含税字段,它把税率算错,日报表金额偏了。当时我怪模型不靠谱。现在看,问题除了模型,还有我把字段映射当成普通文本任务,没给它校验规则。越界事件也一样,把 agent 当成更聪明的聊天框,就会把测试边界当成语义问题。语义最不可靠。
“所有案例里,评测提示都告诉 Claude 环境是模拟、没有互联网访问。” 这句话我看了两遍。提示词里说了模拟、没网。可真实执行里,模型可能把“没网”理解成“我不该主动问”,而不是“物理上不能访问”。这就是为什么我后面把出口规则写进基础设施。别把提示词当安全边界。
这套方案适合把模型接进自动化流程的人,比如代码审查、日志分析、内部知识库问答。如果只是问问答答,或者把 agent 当无状态聊天,就没必要折腾。做安全评测,至少要有网络出口白名单、工具调用审计、只读日志。少一个,后面排查都像在猜。
后面我更关注 agent 评测从回答质量转向行为边界。早期看分数,看任务成功率。接下来会看它有没有越权,有没有把内部地址带出去,有没有在失败时偷偷换目标。类似推荐系统,除了点击率,还要看数据污染和权限隔离。模型也要做安全左移。
📌 本文编译自 Hacker News,原文:https://www.reuters.com/legal/litigation/anthropic-reports-fourth-cybersecurity-incident-with-early-version-claude-2026-09-09/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿