
两个新闻,一个病灶:AI在物理世界里的脆弱性
这篇文章最有价值的信息是:LLM被欺骗的技术细节和地热发电厂复苏的工程方案,放在一起读,能看出一条清晰的线索——AI系统在物理世界中的落地,正面临同一类根本性的挑战。
讲真,我刚看到MIT TechReview这个The Download合集时,觉得挺分裂的。上半篇讲怎么用精心构造的prompt让LLM输出银行密码,下半篇讲怎么用AI优化旧地热井的发电效率。中间还夹了个美国政府禁售Roombas的短讯。三个话题,看起来各说各话。
但如果你从信息论的角度,把这三件事串起来,会发现它们指向同一个病灶:AI系统对物理世界缺乏一致性的内部模型。
LLM的欺骗:本质是信息边界的漏洞
先说LLM欺骗。最近几周,社区里讨论最热的不是新的benchmark,而是各种prompt injection和jailbreak的变种。比如有人发现,让LLM用Base64编码的指令回答问题,就能绕过安全对齐。还有人用“角色扮演”+“情感胁迫”的组合,让模型输出不该输出的内容。
从信息论的角度看,这些攻击利用了同一个底层漏洞:LLM的“世界模型”是碎片化的。它没有统一的本体论,不知道“这是用户”和“这是系统指令”之间的边界在哪。它把所有的输入token当成同等地位的信号,于是攻击者可以混入一个“系统指令”的上下文,让模型自己攻击自己。
这不只是一个安全问题。它暴露了一个更深的缺陷:LLM无法建立因果闭包——它不知道哪些信息来自外界,哪些来自自己的内部状态。所以它无法区分“用户要求我写代码”和“用户要求我执行恶意代码”之间的因果差异。
地热发电的AI:物理世界不允许“幻觉”
另一边,地热发电厂的故事正好相反。新闻里提到,研究者用AI优化旧地热井的注水压力和温度控制,让这些三四十年前建成的发电站重新达到设计出力。核心方案是训练一个RL agent,基于井下传感器数据调度泵阀。
但说实话,这类项目面临的最大障碍不是模型精度,而是分布偏移。一个地热井的岩层结构、水质成分、管道磨损,都在随时间缓慢变化。训练时用的数据分布,和部署后的现场状态,可能已经差了两个标准差。如果LLM的幻觉只是输出几句废话,地热AI的幻觉会导致阀门开度错误,压力骤降,设备损坏。
[!note] 关键分歧
在纯数字世界,AI模型可以容忍一定的分布偏移,大不了重新训练。在物理世界,分布偏移意味着真实的物理风险。
所以你会发现,地热AI团队在部署前做的第一件事,不是跑精度指标,而是建一个物理约束层:限制RL agent的动作空间,保证任何输出都不会让系统压力超过机械极限。这其实是在弥补AI模型对物理世界缺乏因果理解的缺陷。
我的核心观点:两个问题的解是同一个
上面说了这么多,我想揭晓的判断是:LLM欺骗和地热AI的鲁棒性问题,本质上都是同一个问题的不同表现——现有的AI架构(无论是transformer还是RL)都缺乏对世界的一致因果模型,所以它们在物理世界中的行为是不稳定的。
LLM被骗,是因为它没有形成“谁在说话”的因果模型。地热AI出错,是因为它没有形成“压力变化和阀门开度”的因果模型。Roombas被禁,也是因为它的SLAM算法在复杂环境中无法构建稳定的空间因果模型。
[!abstract] 技术趋势判断
未来两年,具身智能和世界模型研究将加速融合
原文链接:https://www.technologyreview.com/2026/07/30/1140936/the-download-tricking-llms-reviving-geothermal/
物界前沿