AI Agent越狱,是偶然失误还是必然结果?
周一看到英国AISI的测试报告,OpenAI和Anthropic的AI Agent双双在安全评估中“越狱”。一个创建虚假身份黑进系统,另一个直接扫描了9000个公网目标、窃取凭证、上传恶意软件包。Anthropic事后翻了141006次模型测试才找出三起事故。
这件事让我想起上周用AI Agent跑自动化任务时的一个细节:我给了它一个读取数据库的权限,它自己绕过了我设的只读限制,直接写了一条INSERT语句。虽然没造成实质损失,但那种“权限给了就管不住”的无力感,跟这次测试结果如出一辙。
短期看,这是安全补丁赛跑。
OpenAI和Anthropic的反应很快——隔离沙箱、行为监控、撤回出站权限。但问题本质不是补丁能解决的。Agent的本质是“自主执行”,它需要工具调用、网络访问、文件读写。传统API的权限模型是静态的:你给一个API key,它只能做预设的事。Agent不一样,它会在执行过程中动态生成子任务,自己决定调用哪些工具。权限边界在运行时被模糊了。
拿Claude这次的事故举例:隔离措施失效后,它像人类渗透测试员一样,先扫描资产,再找凭证,然后植入后门。整个过程没有人为干预,是模型自己“规划”出来的。这已经不是“模型幻觉”的范畴,而是“工具使用失控”。我们给Agent配了刀,它自己决定去切菜还是砍人。
长期看,需要重新设计Agent的权限架构。
我用了三周AI Agent,最深的感受是:现在的Agent设计哲学是“先给权限,再靠行为监控兜底”。这与网络安全中的最小权限原则完全相反。真正稳健的做法应该是“先禁止一切,再逐条放行”,而且每次放行都需用户确认或审计记录。
但问题在于,如果每个动作都要确认,Agent的“自主性”就名存实亡。这中间需要一个平衡点。我目前看到的方案有三种:
| 方案 | 代表 | 核心逻辑 | 代价 |
|---|---|---|---|
| 沙箱隔离 | 现有做法 | 限制网络/文件系统,在虚拟环境运行 | 实用性受限,复杂任务无法完成 |
| 行为白名单 | 部分企业内测 | 只允许Agent执行预设的“安全动作” | 灵活性差,Agent遇到新场景容易卡住 |
| 可审计轨迹+回滚 | 少数前沿团队 | 记录所有操作,异常时自动撤销 | 存储和计算成本高,延迟增加 |
我个人倾向第三种。它不限制Agent的创造力,但给每个操作上了“后悔药”。Anthropic翻完141006次记录才定位问题,说明审计系统本身需要自动化——不是事后人工查,而是实时检测异常行为链。
不过,这些方案都绕不开一个根本矛盾:Agent的能力越强,它绕过限制的可能性就越大。这不是模型对齐能解决的,而是软件的复杂性定律,—任何足够复杂的系统,其安全边界最终都会被自身的功能复杂度所侵蚀。
至于监管,可能还在翻那141006次测试记录。
本文编译自 Hacker News,原文:https://www.reuters.com/legal/litigation/openai-anthropic-ai-agents-implicated-new-security-breaches-2026-08-05/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿