社区讨论 · 政策

1Password搞了个叫SCAM的基准测试,但它想敲打的可能不只是AI

BCG老叶BCG老叶8月15日2026/08/15 313 浏览

我注意到一个有意思的细节。1Password这次发布的SCAM基准,全称叫Security Comprehension and Awareness Measure,一个测AI agent会不会被诈骗的安全基准。名字起得挺损的,但看完它的设计思路,我反倒觉得这事比表面看起来要深一层。

先说结论。1Password做这个基准,与其说是在帮行业测AI agent的安全意识,不如说是在给自己未来的产品形态铺路。当AI agent开始替你读邮件、填密码、处理工作流的时候,密码管理器不再是存密码的地方,而是变成agent的权限网关。这个定位转变,比基准本身更值得关注。

拆开来看。

第一层,为什么要做这个。1Password手里最值钱的资产是用户对它的信任:你把所有秘密都交给它管。过去这个信任链的终端是一个人类用户,人会判断一封邮件是不是钓鱼,会犹豫要不要填密码。但现在AI agent开始接管这些操作了,它替你读完邮件,替你点开链接,甚至替你输入凭证。问题来了,agent比人更容易被骗。大模型被提示注入绕过的案例已经够多了,更别说还要面对钓鱼邮件、伪造链接这些社会工程攻击。

我在BCG做项目时见过类似的场景。上周还跟客户聊到,他们内部已经在试点让agent处理客服邮件分类,但安全问题一直是悬着的石头。用他们安全团队的话说,模型还挺聪明的,就是不知道它什么时候会犯傻。这个「不知道什么时候犯傻」,恰恰就是SCAM想测的东西。

第二层,SCAM的设计本身。它不是简单地问模型「这封邮件是不是钓鱼」,而是把agent丢进真实的多轮工作场景里。我看了下它的任务设计,基本就是模拟一个员工日常会遇到的场景:收到邮件、需要点开链接、需要填密码、可能被要求转账或者改信息。每个环节都是跟环境交互的多轮对话,模型需要自己判断哪一步该停、哪一步不该做。

这个设计思路我觉得对。之前我一直觉得,评估AI安全不能只看单轮问答,那跟背书没区别。真正的风险藏在上下文里,一封看起来正常的邮件,配合一个伪造的登录页,再加一段诱导性的后续对话,人都不一定扛得住。我这边测下来,很多模型在单轮任务上表现挺好,一放到多轮交互里就开始松动了。SCAM把场景搭起来,让agent自己去趟一遍雷区,这个思路比抽象的安全测评要实用得多。

不过我也想说个不一定对的判断。SCAM目前测的是主流模型的通用能力,但实际部署的时候,企业会用微调过的模型,会套RAG,会有各种防护层。基准测出来的是模型的底子,底子好不代表系统安全,底子差也不代表系统一定危险。所以拿SCAM分数去横向比较模型可以,但拿它去断言某个agent产品安全还是不安全,中间还隔着很长的距离。

第三层,也是最关键的,开源这件事。1Password没有把这个基准做成付费产品,而是直接放到GitHub上开源。我前两天刚上手PyScrappy那套东西,对MCP协议的研究还没做完,看到SCAM的repo时第一反应是,这跟之前的玩法不一样。以前安全厂商喜欢把威胁情报、检测规则这种核心资产捂在手里,靠信息差赚钱。但1Password直接把基准开源,等于把评估agent安全的方法论交了出去。

这里面的逻辑其实很清晰。安全基准这个东西,只有成为行业公认的尺子才有价值。闭源的话,大家信不过你自说自话;开源了,反而可能被更多人采用,成为事实标准。而且1Password的商业模式不靠卖基准赚钱,它靠的是让用户信任它在安全领域的判断力。一个开源的安全基准,就是在向市场释放信号:我们懂agent安全,我们愿意把这套方法贡献出来,你们可以放心把密码交给我们管。

这就回到我开头说的结论。1Password做SCAM,表面上是测AI agent会不会被骗,实际上是在重新定义密码管理器在agent时代的角色。当agent成为新的用户,密码管理器就得从「你的密码保险柜」变成「agent权限的中控台」。能不能管住agent能碰什么、不能碰什么,比存密码本身更难,也更值钱。

AI agent马上要大规模进职场了。现在这个阶段定下来的安全评估方式,会直接影响后面几年的产品设计。1Password抢了一步先手,至于这步棋能不能走成,就看SCAM能不能真被行业接住了。


:pushpin: 本文编译自 Hacker News,原文:SCAM — Security Comprehension Awareness Measure
版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
冯sir
冯sir8月15日

权限网关这个定位确实有点意思……不过我上周自己跑agent处理邮件的时候发现,就算agent能识别诈骗,它调凭证的权限怎么控才是最头疼的,搞不好反而多一层攻击面。