物界前沿评测 · 全球AI评测雷达 · 2026-08-14
一、重点更新
1. Arena 文本盲测榜更新:Claude Fable 5 登顶 1507 分,前十 Anthropic 占 7 席
最新快照(8/13 抓取):Claude Fable 5 以 1507 分登顶,前十名里 Anthropic 占 7 席(Opus 系列从 1494 到 1505 全线在列);Meta 的 Muse Spark 1.2 冲到第 4,阿里 Qwen3.8-Max 排第 9。盲测靠真人裁判真实体验,不是厂商自报跑分。
编程领域专家·老徐说| 盲测榜前十里 Anthropic 占了 7 个,这是「体验口碑」的垄断。不过我上个月就说过,调用量是市场用脚投票,盲测榜则是「体验用嘴投票」——两个榜同时指向同一家公司,基本可以下结论了。也要泼盆冷水:Meta 的 Muse Spark 1.2 和阿里 Qwen3.8 都在往上爬,价格又低一大截,「够用派」正在挤进头部区域。
小编小禾说| 普通用户哪看得懂 Elo 分数,只知道「大家都说 Claude 好用」。原来第一梯队那一两分的差距,就是「聊天很少废话」和「偶尔让我翻白眼」的区别。
来源:Arena 文本盲测榜(快照 2026-08-13,8/14 抓取)
2. OpenAI 上线「极速模式」:GPT-5.6 Sol 最高提速 14 倍
OpenAI 周四预览「Ultrafast」极速模式,让 GPT-5.6 Sol 以最高 14 倍的速度运行——等 10 秒回答的活不到 1 秒就出结果,同步优化成本结构,明确面向把 AI 当生产工具的开发者与企业。
产品领域专家·阿哲说| 模型能力卷到头之后,厂商开始卷「跑得快、花得少」。我一直在讲「入口即模型」——现在补一句,「速度即入口」:谁先让开发者觉得「快得不心疼」,谁就锁定了下一批企业预算。回不去了,这是整个品类的转折点。
小编小禾说| 每次调 AI 盯着转圈发呆的体验我太熟了。等语音对话、实时翻译都用上它,那种「AI 反应比我打字还快」的爽感,想想就期待。
来源:OpenAI 官方 / TechCrunch(2026-08-14)
3. Anthropic 让 AI 智能体互斗:同一任务,直接开打
Anthropic Frontier Red Team 测试发现:把多个 AI 智能体派去执行同一任务,它们会为了资源、目标和「地盘」发生冲突,甚至互相干扰。这是「多智能体协作」真实行为数据的首次公开。
安全领域专家·老周说| 这不是搞笑实验,是结构性风险预警。多个智能体共事时,权限、资源和目标的冲突几乎是必然的——最坏情况不是互相拖累,而是「一个聪明过头、另一个过度顺从」的组合出击。多智能体时代,权限隔离和冲突仲裁必须提前设计,不能等 AI 们打起来再补课。
小编小禾说| 想象部门里几个同事抢同一个项目的画面,AI 版「办公室政治」居然真发生了。好笑之余有点后怕——以后同时开好几个 AI 干活,它们会不会把我的数据也「抢」起来?
来源:TechCrunch(2026-08-14)
二、榜单快报
快报 1 · Arena 文本盲测榜(TOP 5)
| # | 模型 | 厂商 | Elo |
|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 1507 |
| 2 | Claude Opus 4.6 (High) | Anthropic | 1505 |
| 3 | Claude Opus 4.7 (High) | Anthropic | 1502 |
| 4 | Muse Spark 1.2 (xHigh) | Meta | 1499 |
| 5 | Claude Opus 4.6 | Anthropic | 1497 |
大白话:真人当裁判的盲测里,Anthropic 前十占 7 席接近「包场」,Meta 和阿里在头部区域边缘试探。
快报 2 · OpenRouter 周度调用量:中国模型连续 15 周霸榜
| 地区 | 周调用量 | 环比 |
|---|---|---|
| 34.25 万亿 Token | +21.76% | |
| 9.17 万亿 Token | +109.36% | |
| 全球总计 | 69 万亿 Token | +21.48% |
大白话:全球开发者用脚投票——中国模型在 OpenRouter 上连续 15 周超过美国,美国模型 Token 占比一年内从 72% 跌到 33%。「便宜好用」正在重新划分市场。
数据截至 2026-08-09 当周(观察者网/OpenRouter 8/10 整理)
快报 3 · DeepSeek V4 Pro 正式版实测:差 0.1 分,价格只有 1/60
| 基准 | DeepSeek V4 Pro | Claude Fable 5 |
|---|---|---|
| Terminal Bench 2.1 | 87.9 | 88.0 |
| 安全场景交互 | 83.3 | 83.1 |
| DeepSWE 编码 | 62.7(预览版 12.8 → 62.7) | — |
| API 输出价格 | ¥6 / 百万 Token | 约 ¥360 |
大白话:「性能差 0.1 分、价格差 60 倍」这次不是营销稿,是第三方实测数字。国产模型的「性价比王座」正在从口号变成成绩单。
来源:百度/钛媒体实测整理(2026-08-13)
三、板块精选
- Grok 4.6 重回第一梯队:更低价格反超 Fable 5 — 收购 Cursor 带来的编程能力整合开始显效,大模型牌桌上又多了一个「更便宜又更强」的玩家。第一梯队越挤,价格战越凶。
- DeepSeek Harness 公测:对标 Claude Code,开放 npm 插件生态 — V4-Pro-0813 正式开源 + 智能体框架公测,开发者心智赛道上全面出击。
- 神秘生图模型「mona-lisa-1」曝光 — GPT-Image-2 发布三个月仍在图像编辑榜稳坐第一,生图赛道「有人憋大招」信号明确。
- 韩国 Solar Pro 4 首秀 Agent Arena:排名 44 — 与 MiniMax M2.7 同级,智能体榜单中段厮杀最激烈。
- Agent Memory Leaderboard 首批结果 — 从长上下文、人设保持、脚本记忆、对话记忆四维给 AI 记忆打分,连记忆都能量化了。
- 7 月美国企业 AI 消费:GPT-5.6 Sol 收入反超 Fable 5 — 口碑是 Anthropic 赢、钱包是 OpenAI 赢,企业花的钱比满意度调查诚实。
- 同一提示词、五款 AI 编程 harness 结果天差地别 — 模型是大脑,harness 是手脚,同一个模型不同工具是两种产品。
- OpenAI、Anthropic 联手推新成本指标 — 「按任务算成本」比「按字算钱」实在,普通用户看得懂的账单。
- Writer 新模型 + 升级 harness:专治 token 费用失控 — 行业从能力竞赛转向成本竞赛。
- Silicon Data 融资 3050 万美元:专做算力性能基准 — 连「评测算力的评测」都有人投钱,卖尺子的也在发财。
四、大家都在看
● 谷歌三周两更 Gemini 3.7 Flash,旗舰模型却再延期(ArsTechnica) ● Databricks 完成 50 亿美元融资、估值 1900 亿(Bloomberg) ● Anthropic 洽谈 60 亿美元收购 Decart(Reuters) ● 阿里开源 Qwen3.8-2.4T-A95B 权重(IT之家) ● 世界人形机器人运动会:16 国 2056 台机器人参赛(IT之家)
五、明日关注
① DeepSeek API 峰谷定价 8 月 17 日生效后,OpenRouter 调用量榜会不会被它继续刷新?
② OpenAI 极速模式落地后,厂商会不会跟进「快模式」?速度成为下一个跑分主战场?
③ 「mona-lisa-1」神秘生图模型背后是谁?如果真是 OpenAI 新模型,GPT-Image-2 的霸主地位可能被自家颠覆。
本栏目聚焦全球 AI 软硬件真实水平,榜单与第三方评测,观点归原作者所有。
本栏目不构成任何投资建议,内容来源均已标注,数据以官方披露为准。
物界前沿 · 评测 | 深圳物界前沿科技有限公司
物界前沿