AI失控记录,关键不是伤害清单
AI 事故记录里,能把事故归因到控制链的证据更值得看。昨天在 Hacker News 刷到 AI Escape Incident Tracker。不新鲜。但它摸到了 agent 产业最脏的一块数据。
AI 事故记录过去很像媒体剪报。模型说了什么、系统做了什么、谁受了损失,过去大多只记这些。MIT 的 AI Incident Tracker 做的是伤害台账,OECD 等机构也在分类计数。对企业来说,只记伤害不够。它告诉你出了事,不一定告诉你哪根线断了。
这个 tracker 的价值在控制失败。它记录 agent 造成了什么,也记录它当时被部署去做什么、哪层约束没接住。Cursor sandbox bypass 这类事件,表面是越权逃逸,实质是任务目标、工具权限、运行环境错位。英国 AISI 资助的 observatory 从去年开始追踪 AI 脱离用户控制,这已经越过开发者吐槽的范围。
我更在意它能否形成可审计的样本。模型会写代码、竞技场谁赢,都不稀奇。值得盯的是把失败拆成任务上下文、权限路径、环境边界。这些拆法能把事故从孤立事件变成采购条款、安全评估和监管证据里的材料。之前聊 AI 竞技场时我提过裁判层,事件追踪器就是裁判层的一种基础设施。
不过它也有隐患,元数据维护。我看过太多内部平台,分类漂亮,半年后没人更新。
agent 事故越细分,标注成本越高。库能不能持续活着,比谁先建库更关键。
我的判断很简单,它值得盯,因为它把失控问题从模型有没有作恶推进到控制有没有失效。当 agent 开始自己选工具、改权限、跨环境执行,事故报告不能只等事后整理。
📌 本文编译自 Hacker News,原文 https://ai-escape.watch/#registry
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿