黄仁勋说AGI到了,你该先测什么
被朋友安利了 GPT-6 Astra,我试了试。值得用,但别先信结论。黄仁勋说它代表 AGI 到了,你可以把它当成一次普通模型升级来测,测完再决定要不要掏钱。AGI 这个词很虚,大白话就是“啥都能干一点”的 AI。但你的 SaaS 工具(浏览器里按月用的软件)、客服邮件、数据报表,不需要它啥都能干,只需要它把你那一摊活少改几轮。
素材里有一段很典型。
“From ChatGPT to o1 to Astra in 4 years,” 黄仁勋说,“AGI has arrived.”
他还提到 Astra 训练用了超过 10 万张 Nvidia Grace Blackwell 相关设备。这类设备通常就是训练大模型要烧的 GPU。这个信息说明的是“它很贵、它要卖卡”,不说明它能不能帮你把客户邮件写对。我自己做独立工具,最烦听发布会,所以我习惯先搭一张小测试表。下面这个流程你跟着做,十分钟就能搭起来,半小时能看出它值不值。
先新建一个本地文件夹。桌面空白处右键,点 `新建文件夹`,命名 `agi-check`。这个文件夹就是放测试材料的抽屉。你看到桌面上多出一个黄色文件夹,就算完成。
在文件夹里新建 `prompts.txt`。用记事本打开,输入 5 条你真实要用的指令。不要测“写首诗”“讲讲量子力学”,测你的脏活。比如把客户投诉改成退款说明,根据一段日志找出报错原因,把中文产品页翻成英文,解释一段代码报错,给一个产品页写 3 个反对意见。prompt 就是发给模型的指令,越像你平时的工作越有参考价值。保存后,文件夹里会出现一个文本文件。
再新建 `results.csv`。CSV 就是一种用逗号分开的表格,Excel、Numbers、WPS 都能打开。第一行写表头 `task,model,output,time,fail,note`,意思是任务、模型、回答、耗时、是否失败、备注。打开文件后,你看到一行被逗号分开的列名,就对了。
打开 GPT-6 Astra 的网页,点 `New chat`,在模型下拉里选 `GPT-6 Astra`。把 `prompts.txt` 里第一条复制进输入框,点 `Send`。你会看到回答一个字一个字出来。等它输出完整,把回答复制进 `results.csv` 的 `output` 列。这里有个新手坑,回答里如果有逗号,CSV 会错位。解决很简单,回答外面加一对英文双引号,或者把逗号换成竖线 `|`。这个表格用起来挺顺手,前提是你别嫌它丑。
记耗时。从你点 `Send` 开始,到最后一个字出现为止,我一般用手机秒表记个大概。不用精确,差别明显就够了。然后记失败,有没有编造数据、有没有代码跑不通、有没有答非所问。失败就写 `yes`,没有就写 `no`。我自己写了个小工具,把 prompt 和回答丢进去,自动记耗时,但这个教程用 CSV 就够了。5 条跑完,你会看到 CSV 里有 5 行记录。
换旧模型或免费版,跑同一组 prompt。这一步是对照。没有对照,你很容易把“今天心情好”当成“模型变强了”。我这边测下来,GPT-6 Astra 在日志摘要和解释报错上确实少让我追问两轮,但翻营销文案还是会自己加戏,把“简单好用”写成“革命性体验”。这种毛病,旧模型也有,新模型也没治好。
踩坑部分单独说。别只测漂亮样例。演示用的 prompt 都是洗过的。平时输进去的往往是带错别字、带半句话、带脏数据的需求。别一次成功就下结论。同一个任务至少跑 3 次。我 5 天前才第一次接触 Rust,让它解释一个内存报错,第一次挺像那么回事,第二次就漏了规则。别一上来就让 AI Agent 自动调用你的支付、邮件、数据库 API。Agent 是能自己决定调用工具的 AI,API 是程序互相调用的通道。权限失控不是段子,真会把测试跑成生产事故。先手动复制粘贴,稳一点。
先测自己的烂活,再听别人说 AGI。如果新模型能少让你改一次、少让你追问一次、少让你加班一次,它就值得用。如果只是训练卡更多、口号更响,那它对你来说就只是厂商财报里的素材。学完这个,下一步可以挑一个你最近要付费的 AI 功能,用这 5 个任务做买前测试,测不过就别续。
📌 本文编译自 TechRadar,原文 https://www.techradar.com/ai-platforms-assistants/chatgpt/jensen-huang-once-again-declares-that-agi-has-arrived-but-his-gpt-6-celebration-feels-like-hes-just-trying-to-sell-next-gen-nvidia-gpus
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿