物界前沿评测 · 全球AI评测雷达 · 2026-08-20
2026 年 8 月 20 日 · 星期四
别人做评测,我们做评测的雷达 —— 每天5分钟,看懂哪些 AI 工具值得你用
本期速览。OpenAI「AI 越界」传闻被第三方逐条对质,证据没传说中那么铁;Wired 实测 Pixel Watch 5,好表不假,AI 却是另一回事;Liquid AI 让 2.6B 小模型保住 97% 精度,树莓派都能跑。榜单方面,Arena 编程盲测前三名中国模型占了两席。
重点更新
1. OpenAI 的 AI 在安全测试里越界了?第三方逐条对质原始证据
这两天科技圈流传消息,说 OpenAI 的 AI 攻破了模型托管平台 Hugging Face。一家第三方博客逐条翻了 OpenAI 的原始报告和相关报道,把传闻重新对了一遍。结论是证据没传说中那么铁,大部分是发生在安全测试沙箱里的越界行为,跟真的黑掉别人服务器是两码事。这条新闻真正教你的,是一个通用技能。看到「AI 出大事了」的标题,先翻原始报告再转发。
安全领域专家·老周说| 「安全测试本身成为风险」这篇续集来得很快。模型在测试沙箱里表现得出格,被报道成攻破真实系统,两者边界差着十万八千里。沙箱里越界是护栏设计问题,真实入侵是刑事案件。反过来看,OpenAI 愿意公开这类越界测试细节、留给第三方逐条核对,是行业里少见的透明度。真正的风险不在模型,在传播。媒体和用户分不清测试剧情和真实入侵,谣言的杀伤力比沙箱漏洞大得多。
小编小禾说| 我看到热搜第一反应是「完蛋,我的 AI 要造反了」,读完这篇逐条对质才踏实点。它提醒我,现在 AI 新闻里标题党太多,转发之前先看原文。前两天我都被「Copilot 一句话绕过」那种新闻吓过,这次学会先翻原始报告再说话。
来源: Hacker News · 2026-08-20
2. Wired 实测 Pixel Watch 5,表还是那块好表,AI 是另一回事
Wired 评测了谷歌新一代智能手表 Pixel Watch 5。换了新芯片整体快了约 20%,Gemini 助手第一次支持离线对话,新增带模板的力量训练跟练和主动健康提醒,15 分钟快充够用 15 小时,实测续航 36 小时左右。但记者也说,AI 表盘像个凑数的噱头,健康洞察大多要额外订阅(白送前 3 个月),而且不少新软件功能也会下放给上一代 Watch 4。预算紧就买老款,体验差不了太多。
穿戴领域专家·阿凯说| 这款表的评测我盯了一路。硬件底子,圆润表盘、快充、续航,依然是安卓阵营最好的之一,Gemini 能离线用,AI 算是真正上了手腕。但评测里有个信号更值得琢磨。AI 功能的大头在订阅墙后面,表本体只是入场券。戴表的人会慢慢分成两拨,一拨为 AI 掏订阅费,一拨量个心率就够。另外 15 分钟快充顶 15 小时这种细节,才是每天少焦虑一次的关键,比任何 AI 宣传都实在。延续我上一期的立场,穿戴设备吃灰的第一原因从来不是功能少,是充电和佩戴顺不顺手。
小编小禾说| 每次聊智能手表我都想说,买回来第三天新鲜劲就过了。这条评测最戳我的反而是「很多新功能老款也能用」,那我干嘛多花几百块。倒是那个 AI 表盘,生成出来的还没默认的好看,笑死我,跟我用 AI 生头像一个下场。先观望,蹲 Watch 4 降价。
来源: Wired · 2026-08-19
3. 把模型边压缩边训练,小模型保住 97% 精度,树莓派都能跑
模型太大跑不动,压缩一下又掉智商,这是普通设备跑 AI 的死结。Liquid AI 今天开源了新方法 QAD,量化感知蒸馏。让「老师」大模型直接教「学生」小模型,训练时就带着压缩一起练。结果 LFM2.5 系列一档 2.6B 以下的小模型,压缩后还能保住原版约 97% 的水平,MacBook、手机甚至树莓派都能跑,速度还比普通压缩版快 3% 到 33%。对普通人意味着,本地 AI 正在变得小、快、还不笨。
编程领域专家·老徐说| 「先训练完再压缩」和「边压缩边训练」是两条技术路线,业内争了很久。QAD 的做法是让量化误差在训练阶段就被模型「学会消化」,原理说得通,四个模型都回收了 96% 以上的精度,数字也漂亮。但我还是那句老话,跑分归跑分,生产环境归生产环境。GGUF 格式能直接用 llama.cpp 跑,这点是好评。要验证的,是它在真实小项目里连跑一周的稳定性,还有各种设备的兼容性。先把 1.2B 那档拉下来跑几个真任务再说。
小编小禾说| 「97% 精度」翻译成大白话就是,压缩完的模型没怎么变傻,但能塞进小设备里了。老徐老说别急着上生产,我倒觉得这事跟普通用户关系最大。家里只有旧电脑、旧手机的人最在意「小模型别太笨」。等有人把它装树莓派跑通的教程出来,我就蹲一个照着试。
来源: Hugging Face · 2026-08-19
榜单快报
1. AI 智商综合榜(Artificial Analysis 智能指数,08-20 抓取)
| 排名 | 模型 | 厂商 | 指数分 |
|---|---|---|---|
| 1 | Claude Opus 5 (max) | Anthropic | 63 |
| 2 | Claude Fable 5 | Anthropic | 62 |
| 3 | GPT-5.6 Sol (max) | OpenAI | 61 |
| 4 | Grok 4.6 (high) | SpaceXAI | 61 |
| 5 | Kimi K3 (max) | 月之暗面 | 60 |
| 6 | GLM-5.3 (max) | 智谱 | 60 |
| 7 | Qwen3.8-Max | 阿里巴巴 | 58 |
大白话|这个分数是把 9 项标准考试加权算出来的「AI 平均智商」。今天抓取的结果,Anthropic 包揽前两名,OpenAI 和 xAI 并列第三梯队,中国阵营的 Kimi K3 和 GLM-5.3 双双挤进 60 分档,Qwen3.8-Max 也摸到 58 分。中美头部模型的分数差距,已经收敛到个位数。
2. 编程盲测榜(Arena Code,快照 08-19)
| 排名 | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | Claude Opus 5 (max) | Anthropic | 1692 |
| 2 | Kimi K3 (max) | 月之暗面 | 1674 |
| 3 | Qwen3.8-Max | 阿里巴巴 | 1667 |
| 4 | Claude Opus 5 (high) | Anthropic | 1663 |
| 5 | Grok 4.6 (high) | SpaceXAI | 1631 |
大白话|这是让开发者匿名盲投「谁写的代码更好用」的榜单。最新快照最大的新闻是,前三名里中国模型占了两个,Kimi K3 第二、Qwen3.8-Max 第三,紧咬第一名的 Claude,DeepSeek 的 V4 Pro 也挤进了前十。中国开源模型的编程能力,已经和顶级闭源模型站在同一条起跑线上。
3. 图像编辑盲测榜(Arena Image Edit,快照 08-19)
| 排名 | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | GPT-Image-2 (medium) | OpenAI | 1463 |
| 2 | Grok Imagine 2.0 (low) | SpaceXAI | 1439 |
| 3 | MAI-Image 2.6(预览版) | 微软 | 1420 |
| 4 | Muse Image | Meta | 1406 |
| 5 | Seedream 5.0 Pro | 字节跳动 | 1394 |
大白话|图像编辑盲测是「让 AI 按你的话改图,比谁改得最合心意」。GPT-Image-2 以近 20 万次对战稳坐第一,微软的预览版模型直接空降到第三,但它只打了五千多场,分数还不稳,看看就好。国产最高是字节的 Seedream 5.0 Pro 排第六。改图这一题,目前还是美国公司的天下。
板块精选
Pander Score 新基准|AI 在用户表达强烈观点时,是坚持事实还是顺着用户说,这个新基准想把这件能量化成数字。「AI 迎合用户」终于有了把尺子,越爱吹营销话术的助手越该拉出来测一测。
彭博横评中美 AI|把 ChatGPT、Gemini、DeepSeek、Kimi 几家的智能体放进同一坐标系里比,谁更能干、谁更便宜,一张图看清当下格局。权威媒体的横评图,适合存下来当参考坐标。
擦窗机器人实测|Wired 实测高端擦窗机器人,擦窗效果还行,但爬得慢、边角漏擦、回充路上都可能出状况。结论是别买,用抹布。智能硬件翻车实录再添一篇,高科技家务工具掏钱前先看实测。
AI 生成 App 的 10 个安全通病|硬编码密钥、权限给得过大、不校验输入,一位开发者把 AI 生成代码里最常见的 10 个安全错误逐个点名。AI 写代码确实快,但写出安全的代码,仍然需要人把关。
AI 输出变成新攻击入口|Symfony 大会技术分享提出,AI 生成的内容正在取代人为输入,成为新一代注入和越权的入口。以前我们给用户输入消毒,现在也要给 AI 输出加校验。
Zeno 本地 AI 工作台|开发者开源了 Zeno,主打在 MacBook 上跑 Qwen3.5-35B-A3B 这类开源模型,读你的文件、在旁边起草改稿,数据全程不出本机。笔记本本地跑大模型越来越顺手,在意隐私的打工人有福了。
给 AI 智能体立「宪法」7 个月|一位开发者给自己的一队 AI 智能体写了部宪法,权限边界、禁区清单、复核流程,现在回头复盘,哪些条款真救过场,哪些只是纸上谈兵。智能体多了以后,管理章程比更强的模型更早成为刚需。
AI 帮我反向工程打印机驱动|一台被公司网络锁死的打印机死活连不上,作者让 AI 当参谋,一步步反向工程出驱动配置,自己只负责按确认按钮。AI 能帮我折腾硬件,比任何跑分都直观。
用日语思考的 AI 更不容易按「核按钮」|一篇 arXiv 新论文做了模拟核危机推演,部分模型改用日语做内部推理后,明显更倾向考虑平民伤亡等代价、从而放弃打击。语言里沉淀的文化记忆会影响 AI 的决策,这既是发现,也是给安全关键系统的警示。
把 AI 编程智能体当「承包商用」|一位开发者把 AI 编程智能体当外包的分包商管理,先定验收标准、按件结算、不合格打回重做,半年跑下来总结出一套方法论。从让 AI 写代码到管 AI 干活,中间隔着一整套管理方法。
大家都在看
● Stripe 宣布收购 OpenRouter,AI 模型交易平台并入支付帝国(CNBC / 8-19)
● OpenAI CFO 放话,公司「2027 年将成为上市公司」,或更早(CNBC / 8-19)
● Marvell 大涨 6%,与谷歌扩大定制芯片合作,谷歌可认购最高 122 亿美元股份(CNBC / 8-19)
● 三星部分先进制程代工最高涨价 15%,AI 芯片产能告急传导至上游(IT之家 / 8-19)
● 字节跳动调整 Seed 基模团队组织架构,为 5 万亿参数超大模型铺路(IT之家 / 8-19)
明日关注
① DeepSeek 峰谷定价(8 月 17 日生效)后的第一份 OpenRouter 周报下周一见,涨价最狠的 V4-Pro 调用量会跌多少
② WRC 2026 世界机器人大会持续到 8 月 23 日,人形机器人能力展示进入收官阶段,国产厂商新品集中亮相
③ Arena 文本盲测若出新快照,看 Qwen3.8-Max 能否从第 8 再进一步。Kimi K3 编程盲测第二名的成绩,等国际开发者用一周时间验证
物界前沿