让AI自己玩传送门,先搭个不烧钱实验台
最近有个实验很热。新闻里说,OpenAI 在 9 月 3 日发布的 GPT-6 Astra,被一名爱好者拿去自主通关《传送门》,耗时 24 小时,成本 571 美元。很多人看完想自己跑一遍,但痛点很直接,不知道从哪开始,还怕一开机就烧钱。
我的建议是,别急着通关。产线上实际跑过吗,我一般先问这句。通关是结果,能不能稳定截图、理解画面、发出动作、留下日志,才是可复制的流程。我用 OpenAI API 大概一个月,这几天按这个思路试了个小实验,目标是用十分钟跑通 AI 看屏幕并决定下一步按什么键。
先准备三样东西,一台能运行《传送门》的电脑,一个 OpenAI 账户,一段能截图和模拟按键的脚本。脚本可以理解成流水线机械手,它自己不会判断,但能把云端指令变成鼠标键盘动作。
拿 API 密钥时,登录 OpenAI 网站,进入 API 页面,点 `Create new secret key`,看到密钥弹窗后复制那串字符。这个密钥相当于工厂门禁卡,别发到群里,别写死在代码里。新手常把它上传到 GitHub,解决办法是用本地环境变量保存。
建环境时打开终端,输入下面命令。
看到 `(.venv)` 说明环境激活。这里 `mss` 负责截屏,`pyautogui` 负责模拟按键,`python-dotenv` 读取本地配置。
写预算配置时新建 `.env`,填入下面内容。
bash
OPENAI_API_KEY=粘贴你的密钥
MAX_COST_USD=小额预算
MAX_STEPS=300
新闻里的 571 美元是完整实验,个人复现没必要一上来就烧到这个量级。先设一个小额预算,跑通再说。
搭主循环时,核心逻辑可以拆成五步。每三秒截一次游戏画面。裁剪或缩小画面,只保留中间区域,减少 token 消耗。token 可以粗略理解成模型读图读字时按量收费的单位。把截图发给 GPT-6 Astra,让它返回一个 JSON 动作,比如 `{"action":"w","duration":0.3}`。脚本只允许白名单动作执行,比如 `w`、`a`、`s`、`d`、`mouse_click`。把时间、动作、token、成本写进日志。
日志字段建议包括 `step`、`time`、`action`、`tokens`、`cost`、`screenshot_path`。预期结果是终端每隔几秒打印一行动作、token 和累计成本。没有日志,实验就只能看个热闹。
新手最容易在三个地方出错。截图太大,全高清原图直接丢给模型,成本涨得很快,解决办法是裁剪到较小尺寸。游戏窗口失焦,脚本按了键,游戏没反应,解决办法是每次动作前激活窗口。没有停止条件,模型可能反复按同一个键,解决办法是连续几步画面变化很小就暂停。
这个实验的优势是流程简单,适合理解多模态模型和自动执行器怎么配合。劣势是成本、延迟和误操作都不可控。机会是它能迁移到工业质检,摄像头看缺陷,模型给判定,执行器分拣。风险是模型幻觉,画面没变化也以为自己成功。
| 对比项 | 新闻实验 | 新手最小实验 |
|---|---|---|
| 目标 | 通关 | 跑通截图到动作 |
| 时长 | 24 小时 | 10 分钟 |
| 成本 | 571 美元 | 控制在小额预算 |
| 输出 | 游戏结果 | 动作日志 |
学完这个,下一步可以试一个更简单的网页解谜,把 `MAX_STEPS` 降到一百步以内,专门验证失败恢复和日志复盘。
从产线视角看,AI 把感知、决策、执行、记录串起来,这件事比玩解谜游戏更有用。质检设备也一样,相机是眼睛,模型是大脑,气缸是手,MES 是日志。良率提升多少,往往取决于这套流程能不能稳定跑。
先别追通关,先把预算、日志和失败恢复搭起来。
物界前沿