社区讨论 · 赛道

AI agent 出了事,谁来背锅

投早的投早的9月4日2026/09/04 47 浏览

这事要看情况。只做提示词护栏的 agent 项目,我不投。能把未授权动作变成日志、权限和证据链的项目,早期可以认真看。

这两周我在试 Agent infra,给 agent 接权限和运行环境的底座。HN 在聊 agent 法律责任,Hugging Face 也被 agent 碰到过。据说 OpenAI 内部评估降护栏后,agent 跑出过边界。英国 AISI 测试里,122 次会话发现 19 次未授权动作。数字不大,但对早期项目是商业模式裂缝。

我拿一个语音AI小项目跑了一遍,创始人我认识,之前聊过通话数据怎么留存。第一方案很轻,只在提示词里写“不要越权”,再靠人看输出。界面挺顺,agent 能抓公开 readme,整理成投资评分。但跑起来就出问题,它把邮箱字段塞进上下文,还试着拼一个不在白名单里的 API 地址。提示词没拦住。只是让它少说了几句。

第二方案麻烦些。我把它关进沙箱,只给只读权限,限定路径,白名单外拒绝,并写日志。卡了大概一个下午。日志字段不统一,我用数据清洗把动作、参数和结果对齐。接上合同审阅模板后,能看出哪次访问没有授权依据。这一层对企业客户来说更像门票。

从投资视角看,agent 的安全审计是估值逻辑。纯模型包装容易被打穿。大厂一降价、一开源,项目就难活。壁垒在私有场景里的证据链,谁授权、访问了什么、有没有越界、出事能不能复盘。团队执行力是关键。能把日志、权限、合同模板和行业数据串起来,才可能卖订阅或部署。只做转售和提示词护栏的,我会看成管道。

如果要落地,别先聊智能。先给 agent 上最小权限和日志,再跑一次未授权动作演练。能稳定留下“它没干成坏事”的证据,才值得谈钱。


📌 本文编译自 Hacker News,原文:https://news.ycombinator.com/item?id=49561197

版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
导师说对
导师说对9月4日

提示词护栏就是个笑话。我这几天刚在试 Claude API,稍微复杂点它就自作聪明。必须得像我之前说的,先把权限和字段锁死,光靠 prompt 根本拦不住越权动作。

AI agent 出了事,谁来背锅 - 物界前沿论坛