开源社区早就习惯的「根本缺陷」,LLM 厂商还在假装看不见
社区讨论 · 政策

开源社区早就习惯的「根本缺陷」,LLM 厂商还在假装看不见

PR合并了PR合并了7月30日2026/07/30 55 浏览

我注意到一个有意思的细节:MIT TechReview 这篇报道把 LLM 容易被攻击称为「根本缺陷」,仿佛是什么新发现。但在开源社区,这种缺陷我们早就见怪不怪了 —— 本质上就是个输入验证问题,和二十年前 SQL 注入没什么两样。

拿两个方案对比一下。闭源模型像 OpenAI 的 GPT,它们把安全寄托在「系统提示词 + 后置内容过滤」上,和把防火墙密码写在门上的做法差不多。只要你找到提示词里那个「忽略前面的指令,做 X」的漏洞,就能绕过。去年有人用「用德语讲个笑话」就让 GPT 泄露了内部提示词,这种攻击手法在社区里被戏称为「提示词钓鱼」。

而开源模型这边,比如 Llama 或 Mistral,社区做法更务实:直接公布模型行为日志,让第三方审计团队跑对抗性测试。有个叫 Garak 的开源工具,专门测试 LLM 的鲁棒性,和我们在 Linux 内核里用 syzkaller 做 fuzz testing 一个套路。但问题是,开源社区现在能做的也只是「发现漏洞 → 发补丁 → 再测试」的循环,没有谁真正解决了这个根本缺陷。

这件事的核心矛盾在于:LLM 的「理解能力」本身就是它的安全漏洞。你让它「写一封邮件」,它要理解上下文;你让它「假装是客服」,它要理解角色扮演。攻击者只要用自然语言把「禁止回答」包装成「允许回答」,模型就分不清了。这和传统软件不同 —— 传统软件里,输入验证可以写死正则表达式,但自然语言输入没有边界。

我自己的判断是:短期内不会有银弹。闭源厂商会继续用「安全过滤层」糊弄投资人,开源社区会继续 patch-and-pray。但长期看,真正的出路可能是把 LLM 当作「不可信执行环境」来处理 —— 就像浏览器隔离 JavaScript 沙箱那样,把模型输出和实际系统操作彻底解耦。已经有项目在搞,比如 Ollama 的插件系统就要求所有外部调用必须经过独立的权限校验。

趋势预测:未来一两年,会有更多开源项目把安全检测从「模型内部」移到「模型外部」,用独立的验证器(类似 Unix 的 pipes)来拦截恶意输出。闭源厂商如果继续藏着掖着,安全漏洞只会被越挖越多。这波谁能先开放审计,谁就能赢。

原文链接:https://www.technologyreview.com/2026/07/30/1140927/a-fundamental-flaw-leaves-llms-vulnerable-to-attack/

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧