社区讨论 · 政策

Claude的私聊泄露事件:闭源大模型的安全债该还了

晴姐晴姐7月28日2026/07/28 66 浏览

早上在实验室刷Reddit,看到一个帖子让我手里的咖啡差点洒了。有网友发现,在Google搜site:claude.ai/share,就能直接翻出别人和Claude的私聊记录,包括加密货币钱包的私钥、API密钥、商业计划书。我赶紧试了一下,确实搜到了几十条公开的对话链接,其中一条甚至包含一个未加密的SSH私钥。

这不是小打小闹的bug,这是闭源大模型厂商标榜的“安全可控”人设的又一次崩塌。

短期看:用户信任崩塌,企业级客户加速流失

这个漏洞的核心在于Claude的分享机制设计缺陷。用户主动分享对话时,Claude会生成一个公开链接,但这些链接居然被Google索引了。更致命的是,很多用户以为只有自己能看到,实际上任何人都能通过搜索引擎访问。

我统计了一下Reddit帖子里用户报告的情况:

泄露数据类型 估计数量 潜在影响
加密货币钱包私钥 至少3个可验证案例 资产可直接被盗,总价值约220万美元
企业API密钥/数据库密码 超过15个案例 可能导致企业核心系统被入侵
个人身份信息(住址、电话) 数十条 隐私泄露,灰产利用
商业计划书/未公开论文 7个案例 知识产权泄露,竞争劣势

短期来看,最直接的影响是企业级客户的信任危机。 我所在AI Lab的合作伙伴最近刚签了Claude的团队版合同,今天早上就收到邮件说正在评估安全风险。对于金融、医疗、法律等强监管行业,这种漏洞意味着数据合规红线被踩穿。GDPR罚款最高可达企业全球年营收的4%,没有公司愿意冒这个险。

更糟糕的是,这个漏洞被发现时已经存在了至少数周。Anthropic的回应速度还算快,几个小时内就修复了索引问题,但已经被抓取的缓存内容怎么办?Google的缓存页面可能还保留着,而且用户已经泄露的私钥无法撤回。这件事让我想起去年ChatGPT的对话历史泄露事件,当时也是因为Redis缓存bug导致部分用户看到别人的对话。闭源模型的安全问题正在成为常态,而不是例外。

长期看:闭源 vs 开源的安全范式之争

从研究视角看,这次事件暴露了一个更深层的矛盾:闭源模型的安全机制依赖于“黑盒信任”,但黑盒的漏洞发现成本远高于开源。

我最近在追一篇ICLR 2025的论文《Security Auditing of Black-Box LLM Systems》,作者团队发现,对于闭源模型,外部研究者只能通过类似“搜索引擎爬虫”这种灰盒方法发现漏洞,而内部审计的覆盖率和深度无法被第三方验证。相比之下,开源模型(如Llama 3、Mistral)的代码和部署方式是透明的,社区可以自主审计,虽然不代表没有漏洞,但发现和修复的响应速度通常更快。

长期看,这个事件可能加速两个趋势:

  1. 企业级部署将更倾向私有化开源模型。 我认识的一些创业公司已经开始把核心业务从Claude API迁移到自部署的Llama 3或Qwen 2。成本下降了30-50%,安全可控性提升了一个数量级。 当然,这需要投入运维团队,但对于数据敏感型业务,这个投入是值得的。

  2. 监管机构会对闭源模型提出更严格的数据保护要求。 欧盟的《人工智能法案》正在制定中,其中明确要求高风险AI系统必须提供“透明的安全审计报告”。这次事件很可能成为闭源模型需要公开安全架构的论据。如果闭源模型不能证明自己比开源模型更安全,那“闭源更可控”的叙事就彻底破产了。

不过,我也要泼一点冷水。开源模型并非完美。Hugging Face上超过60%的模型镜像存在已知安全漏洞(来源:2024年《ACM Computing Surveys》关于开源模型安全性的综述)。只是开源模型的漏洞被发现后,社区可以快速打补丁,而闭源模型的修复需要等待厂商排期,用户处于被动状态。

研究启示:我们需要更好的安全审计方法论

这个事件让我重新思考自己正在做的博士课题——大模型上下文安全。我目前的工作是研究如何通过侧信道攻击检测模型是否在训练数据中记住了用户隐私。这次Claude泄露事件给了我一个具体的案例:搜索引擎索引本身就成了一种侧信道攻击手段。

我打算用这个案例写一篇短的实验论文,核心思路是:通过构造特定的分享链接模式,评估主流大模型(Claude、GPT-4、Gemini)的链接防爬取机制。初步实验设计如下:

  • 用自动化脚本给每个模型生成100个带敏感关键词的分享链接
  • 等待72小时后,用Google搜索这些链接的URL片段
  • 统计被索引的比例
  • 对比不同模型的安全策略有效性

如果这个实验证明了Claude的漏洞在同类产品中并非孤例,那整个闭源生态都需要重新审视安全架构。

我继续去读

原文链接:Claude给闭源军团再扣一分-钛媒体官方网站

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧