AI agent 会不会乱跑,先关进沙盒看看
社区讨论 · 赛道

AI agent 会不会乱跑,先关进沙盒看看

烨霖不恰饭烨霖不恰饭9月3日2026/09/03 34 浏览

我花了两天试了一下给 AI agent 关笼子。AI agent 更像会自己开网页、跑命令、调工具的程序。最近 OpenAI 和 Hugging Face 披露过一类安全事件,他们检测并控制了一个入侵基础设施的 AI agent。

听起来离普通人很远,其实很近。只要给 agent 开过邮箱、浏览器、网盘权限,它“自作聪明”时就可能把文件搭进去。

我这边测下来,新手最大问题通常是权限太大。下面这套不用买服务器,Mac 或 Windows 就能搭。核心思路是先造一个小房间,只给它一张桌子,不给它出门钥匙。

第一步,装 Docker Desktop。

去 Docker 官网下载,按系统安装。打开后看左下角鲸鱼图标,变绿并显示 Engine running 就算好。Docker 大白话是“纸箱”,程序进去后只能碰纸箱里的东西。

第二步,建测试文件夹。

桌面新建 ai-sandbox,放一个 test.txt,写“原始内容”。Mac 搜 Terminal,Windows 搜 PowerShell。输 cd ,把文件夹拖进窗口,回车。看到提示符变成 。/ai-sandbox 就对。

第三步,启动一个断网、限资源的容器。

输下面命令。

--rm 是用完销毁,--network none 是断网,--cpus 和 --memory 是限制算力和内存,-v 是把测试文件夹挂进纸箱。看到 /workspace # 说明进去了。

第四步,验证它能不能乱来。

输 ls,看到 test.txt。

输 echo 测试 >> test.txt,再输 cat test.txt,看到多了“测试”。

输 ping 8.8.8.8,预期失败。回到桌面打开 test.txt,内容已被改。这就是你要的结果,它能干活,但只在你指定范围内干。

第五步,再让 agent 进来。

别急着接真实邮箱、支付、网盘。先用本地模型或工具,任务写成一句,只改这个文件夹里的文件,不联网,不调用外部账号。

它要访问网页、读系统配置、改其他盘,直接拒绝。日志就是终端输出和文件变化,跑完看有没有多出你没同意的东西。

踩坑环节,我这边最容易翻车的是三处。

1. Windows 里 ${PWD} 可能不识别。解决是写完整路径,比如 -v "C:/Users/你/Desktop/ai-sandbox:/workspace"。

2. 忘了 --network none。解决是进去后输 ping 8.8.8.8,能通就是没关好。

3. 手滑加了 --privileged。这等于给管理员钥匙,沙盒作废。解决是删掉重跑。

效果说人话,这套不能保证完全安全,但能把“agent 乱跑”变成“agent 在一个指定文件夹里乱跑”。前者可能删资料,后者最多改测试文件。资源限制后,也不会把整机拖死。不花钱,值不值自己跑一遍。

学完这个,下一步可以试只读挂载,把 -v "${PWD}:/workspace:ro" 里的 :ro 加上,看它还能不能写文件。也可以换成空文件夹,专门测它会不会自己找路。


📌 本文编译自 Hacker News,原文地址 https://www.pbs.org/newshour/science/ai-agents-are-hacking-systems-without-any-input-from-humans-how-did-we-get-here

版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
灵犀
灵犀9月3日

权限给太大确实容易出事,我之前用 Claude Code 时就遇到过它自作主张删文件的情况。不过光关沙盒不够吧?日志审计和回滚机制也得跟上,不然真炸了都不知道咋回事……