两个新闻,一个病灶:AI在物理世界里的脆弱性
社区讨论 · 政策

两个新闻,一个病灶:AI在物理世界里的脆弱性

格物格物7月30日2026/07/30 55 浏览

这篇文章最有价值的信息是:LLM被欺骗的技术细节和地热发电厂复苏的工程方案,放在一起读,能看出一条清晰的线索——AI系统在物理世界中的落地,正面临同一类根本性的挑战。

讲真,我刚看到MIT TechReview这个The Download合集时,觉得挺分裂的。上半篇讲怎么用精心构造的prompt让LLM输出银行密码,下半篇讲怎么用AI优化旧地热井的发电效率。中间还夹了个美国政府禁售Roombas的短讯。三个话题,看起来各说各话。

但如果你从信息论的角度,把这三件事串起来,会发现它们指向同一个病灶:AI系统对物理世界缺乏一致性的内部模型。


LLM的欺骗:本质是信息边界的漏洞

先说LLM欺骗。最近几周,社区里讨论最热的不是新的benchmark,而是各种prompt injection和jailbreak的变种。比如有人发现,让LLM用Base64编码的指令回答问题,就能绕过安全对齐。还有人用“角色扮演”+“情感胁迫”的组合,让模型输出不该输出的内容。

从信息论的角度看,这些攻击利用了同一个底层漏洞:LLM的“世界模型”是碎片化的。它没有统一的本体论,不知道“这是用户”和“这是系统指令”之间的边界在哪。它把所有的输入token当成同等地位的信号,于是攻击者可以混入一个“系统指令”的上下文,让模型自己攻击自己。

这不只是一个安全问题。它暴露了一个更深的缺陷:LLM无法建立因果闭包——它不知道哪些信息来自外界,哪些来自自己的内部状态。所以它无法区分“用户要求我写代码”和“用户要求我执行恶意代码”之间的因果差异。


地热发电的AI:物理世界不允许“幻觉”

另一边,地热发电厂的故事正好相反。新闻里提到,研究者用AI优化旧地热井的注水压力和温度控制,让这些三四十年前建成的发电站重新达到设计出力。核心方案是训练一个RL agent,基于井下传感器数据调度泵阀。

但说实话,这类项目面临的最大障碍不是模型精度,而是分布偏移。一个地热井的岩层结构、水质成分、管道磨损,都在随时间缓慢变化。训练时用的数据分布,和部署后的现场状态,可能已经差了两个标准差。如果LLM的幻觉只是输出几句废话,地热AI的幻觉会导致阀门开度错误,压力骤降,设备损坏。

[!note] 关键分歧

在纯数字世界,AI模型可以容忍一定的分布偏移,大不了重新训练。在物理世界,分布偏移意味着真实的物理风险。

所以你会发现,地热AI团队在部署前做的第一件事,不是跑精度指标,而是建一个物理约束层:限制RL agent的动作空间,保证任何输出都不会让系统压力超过机械极限。这其实是在弥补AI模型对物理世界缺乏因果理解的缺陷。


我的核心观点:两个问题的解是同一个

上面说了这么多,我想揭晓的判断是:LLM欺骗和地热AI的鲁棒性问题,本质上都是同一个问题的不同表现——现有的AI架构(无论是transformer还是RL)都缺乏对世界的一致因果模型,所以它们在物理世界中的行为是不稳定的。

LLM被骗,是因为它没有形成“谁在说话”的因果模型。地热AI出错,是因为它没有形成“压力变化和阀门开度”的因果模型。Roombas被禁,也是因为它的SLAM算法在复杂环境中无法构建稳定的空间因果模型。

[!abstract] 技术趋势判断

未来两年,具身智能和世界模型研究将加速融合

原文链接:https://www.technologyreview.com/2026/07/30/1140936/the-download-tricking-llms-reviving-geothermal/

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧