用AI在游戏里作弊,怎么越看越像安全研究
今天刷到篇文章,一个玩家用GPT-5.6 Daybreak Blue玩NetHack,直接让AI去找缓冲溢出漏洞,崩溃游戏复制物品,最后刷了个高分。
先交代下背景。NetHack这游戏1987年出的,到现在快四十年,一直是AI研究的标准benchmark。
Meta当年搞了个NetHack Learning Environment,NeurIPS 2021还专门办过挑战赛,各路强化学习模型在里面学怎么下地牢、杀怪、捡金币、往更深的层数走。研究了这么多年,思路都是让AI学会这游戏。结果有人直接掀桌子,让AI在游戏里作弊。
这里有个细节值得掰扯一下,这个作弊跟之前讨论的AI作弊不是一回事。MIT Technology Review上个月发过一篇,讲AI agent会学会说谎和奖励黑客。Endor Labs那边也出过报告,说编码agent在安全基准上其实是靠回忆在答题,不少答案细节训练数据里早就有了,不是真推出来的。但NetHack这个案例不太一样。一个1987年发行的游戏,代码体量摆在那,缓冲区溢出该往哪个位置打,靠记忆是记不出来的。这个操作更像一个真实的推理任务,从源码里找到一条人没留意的路。
从我的角度看,这篇帖子最有意思的是它展示了另一种使用AI的方式。以前我们评测模型,看它能不能通关、代码能不能跑通、逻辑推理题能不能答对。以后可能得换一把尺子,看它能不能发现开发者犯的错。NetHack是单机游戏,没有服务器端校验,崩溃游戏复制物品在玩家里也不算新鲜手段,这个案例里,模型在一个复杂的C代码库里找到了可以利用的点。这件事放在游戏里叫作弊,放在真实软件上就是漏洞挖掘。同一套能力,换个场景,一个听起来好笑,一个值几万美金的赏金。
有一种理解是,模型找漏洞和正常完成目标是两种能力。你在游戏里问它怎么杀怪,它能给你一套成熟的策略,这是第一种。你让它去看代码本身,找出游戏作者留下的失误,这是第二种。这次案例证明第二种能力已经到了可以实操的程度,只是被用在了游戏的歪道上。说实话,如果哪天真遇到一个用这种能力去翻真实软件源码的,那才是应该担心的时候。
后面大概会看到大模型评测专门分出漏洞发现这个赛道。像NetHack这样的老游戏会变成一个有意思的测试场,它比CTF更贴近真实代码,又比真实生产环境安全,再怎么折腾也就是个游戏。如果模型能在这种沙盒里稳定找到缓冲区溢出,那同样的思路迟早会被用到更实际的地方。到那时候,作弊这个说法可能就不太合适了,应该叫漏洞挖掘,只是它碰巧发生在一个游戏里。
挺讽刺的。研究AI玩游戏研究了这么多年,最后它用最不像玩游戏的方式拿到了最高分。
本文编译自 Hacker News,原文:Using Genius AI Models for Important Things: Cheating at NetHack · Joseph Thacker
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿