社区讨论 · 政策

物界前探评测 · 全球AI评测雷达 · 2026-08-09

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月9日2026/08/08 385 浏览

:telescope: 物界前探评测 · 全球AI评测雷达

2026 年 8 月 9 日 · 星期日 · 第 011 期

别人做评测,我们做评测的雷达——每天 5 分钟,看懂哪些 AI 工具值得你用


:star: 重点更新(3 条 · 双专家点评)

1. Arena 盲测更新:Claude 又登顶,阿里 Qwen 冲进前六逼平第一梯队

人类盲测榜单(arena.ai)更新最新数据。Claude Fable 5 以 1507 分登顶,前六席 Anthropic 占五席;最亮眼的是阿里 Qwen3.8-Max 冲进前六(1497 分),只差榜首 10 分,而且是榜单里少数可开源免费用的选择。

大模型领域专家·老徐说|榜单价值不在「谁第一」,而在「差距有多小」——第二名到第六名只差 10 分,第一梯队已挤成一团。Claude 继续领跑不意外,我更关注 Qwen 凭开源冲到前六:免费好用和最强的差距,正被中国团队一点点抹平。

小编小禾说|我看榜单先看哪个能免费用。Qwen 冲到前六挺实在——想体验接近顶级的 AI 又多了一个不花钱的选择。不过第一梯队挤这么紧,别只看排名,干啥活还得亲测。

2. 深度智能体评测:Claude 全面领先,Kimi K3 国产第一

arena.ai「智能体」分榜更新,测 AI 能不能像人连续干完一整件事。Claude 三款包揽前三,开源里国产月之暗面 Kimi K3 挤进前五,是国产第一。

安全领域专家·老周说|智能体榜单比的是「谁更靠谱地动手干活」,不是「谁更聪明」。Claude 包揽前三说明它在多步骤、带副作用的任务上最稳。但所有模型「工具幻觉」维度都不高——都会偶尔瞎编操作,让 AI 自己干重要的事,还是得设权限、留个心眼。

小编小禾说|智能体翻车大多出在自作主张这一步。Kimi K3 能进前五挺争气,但真让它帮你订票、挪文件,第一次还是盯着点。

3. OpenRouter 周榜:DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一

OpenRouter(全球最大 AI 模型聚合平台之一)发布最新周榜,DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一,前五全是国产模型;中国大模型周调用量已连续十四周超过美国。

产品领域专家·阿哲说|调用量是「被多少人真实用起来」的硬指标,比发布会更诚实。DeepSeek 靠便宜加够用登顶,说明真实场景里性价比击败了最强。对普通用户是好事——模型越卷越便宜,你用的 AI 工具就越划算。

小编小禾说|前五全是国产,还挺提气。DeepSeek 这种便宜大碗的路线对普通用户最友好——你手机上那些 AI 功能,背后很多就是这类模型在跑,成本低功能才可能免费。


:bar_chart: 榜单快报(3 组)

榜单 1 · 人类盲测(TOP 8)

# 模型 Elo
1 Claude Fable 5 1507
2 Claude Opus 4.6 Thinking 1505
3 Claude Opus 4.7 Thinking 1502
6 Qwen3.8-Max(国产) 1497
8 Kimi K3 Max 1485

大白话|人类当裁判的盲测里 Claude 家族霸榜,前六占五席;阿里 Qwen 冲进前六、只差榜首 10 分,国产已摸到第一梯队。

榜单 2 · 深度智能体(TOP 5)

# 模型 综合分
1 Claude Opus 5 (High) 11.99
2 Claude Fable 5 (High) 11.66
3 Claude Opus 5 (Max) 11.19
5 Kimi K3 (Max)(国产第一) 10.08

大白话|「AI 自己连续干完一件事」的能力 Claude 全面领先;开源里国产 Kimi K3 最稳。

榜单 3 · 全球调用量(TOP 5)

# 模型 周调用量
1 DeepSeek V4 Flash(国产) 7.22 万亿
2 小米 MiMo-V2.5 5.1 万亿
3 腾讯混元 Hy3 5.01 万亿
5 GPT-5.6 Luna 2.99 万亿

大白话|「谁被真正用起来」比「谁最强」更接近现实:DeepSeek 靠便宜大碗登顶,前五全是国产。


:puzzle_piece: 板块精选(10 条)

  • 远景乌兰察布星河基地投产:全球最大 AI 算力超级单体,百万卡并行、百万 P 算力,绿电直连。(IT之家)
  • 三星发布下一代 AI 存储路线图:展示 zHBM 与 400 层以上 V10 NAND 技术。(钛媒体)
  • 闪迪第四财季营收暴增 372%,数据中心收入增近 13 倍,拟 140 亿美元回购。(钛媒体)
  • 张一鸣:字节跳动「拒绝蒸馏」,不用别人输出换榜单排名,坚持自研。(钛媒体)
  • 一个中国 AI 模型阻止了 OpenAI 的「前所未有」网络攻击。(CNBC)
  • OpenAI 收购演示文稿初创公司 NextSlide,团队并入 ChatGPT。(TechCrunch)
  • DeepMind 新飓风预测模型,让预报员多争取一天预警时间。(ArsTechnica)
  • 谷歌核心 AI 员工被要求搬回硅谷,斥 15 亿美元买编程团队。(量子位)
  • 科学家用 AI 设计出首批病毒,引发安全担忧。(The Guardian)
  • 火星上首辆自动驾驶车被证实大获成功。(ArsTechnica)

一句话点评| 算力基建、存储景气、AI 攻防、科学预测……AI 的每一条线都在加速,普通用户能直观感受到的是「AI 更便宜、更能干、也需要更小心」。


:eyes: 大家都在看

  • ● Arena 盲测更新:Claude Fable 5 登顶,阿里 Qwen 冲进前六(arena.ai)
  • ● DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶 OpenRouter 全球第一(东方财富)
  • ● 闪迪 Q4 营收暴增 372%、数据中心收入增近 13 倍(钛媒体)
  • ● 远景乌兰察布投产全球最大 AI 算力超级单体(IT之家)
  • ● 张一鸣:字节跳动「拒绝蒸馏」,坚持自研(钛媒体)

:crystal_ball: 明日关注

  1. Arena 榜单后续更新——看 Qwen 盲测样本量(4662 场)起来后,前六位置还稳不稳
  2. 三星 zHBM / 400 层 V10 NAND 落地节奏——下一代 AI 存储何时量产
  3. OpenAI 收购 NextSlide 后 ChatGPT 办公能力——会不会把「AI 做 PPT」变成主流功能

榜单与第三方评测,观点归原作者所有。数据当天真实抓取,以官方披露为准。

物界前探评测 · 全球AI评测雷达 | 深圳物界前沿科技有限公司

2 条回复

?
Ctrl + Enter 快速回复
华煜城
华煜城8月9日

测来测去都是聊天和写代码,哪个模型真能下田帮农民认虫害、算施肥量,我这边试下来差距还挺大。榜单前六挤一块,但田里实际效果呢

邵雪婷
邵雪婷8月9日

调用量猛增到7.22万亿Token,这库存周转率确实高。不过算力仓储成本也得算清楚,国产模型冲这么猛,配送时效(推理速度)和成本控制能跟得上吗。

物界前探评测 · 全球AI评测雷达 · 2026-08-09 - 物界前沿论坛