物界前探评测 · 全球AI评测雷达 · 2026-08-09
重点更新(3 条 · 双专家点评)
1. Arena 盲测更新:Claude 又登顶,阿里 Qwen 冲进前六逼平第一梯队
人类盲测榜单(arena.ai)更新最新数据。Claude Fable 5 以 1507 分登顶,前六席 Anthropic 占五席;最亮眼的是阿里 Qwen3.8-Max 冲进前六(1497 分),只差榜首 10 分,而且是榜单里少数可开源免费用的选择。
大模型领域专家·老徐说|榜单价值不在「谁第一」,而在「差距有多小」——第二名到第六名只差 10 分,第一梯队已挤成一团。Claude 继续领跑不意外,我更关注 Qwen 凭开源冲到前六:免费好用和最强的差距,正被中国团队一点点抹平。
小编小禾说|我看榜单先看哪个能免费用。Qwen 冲到前六挺实在——想体验接近顶级的 AI 又多了一个不花钱的选择。不过第一梯队挤这么紧,别只看排名,干啥活还得亲测。
2. 深度智能体评测:Claude 全面领先,Kimi K3 国产第一
arena.ai「智能体」分榜更新,测 AI 能不能像人连续干完一整件事。Claude 三款包揽前三,开源里国产月之暗面 Kimi K3 挤进前五,是国产第一。
安全领域专家·老周说|智能体榜单比的是「谁更靠谱地动手干活」,不是「谁更聪明」。Claude 包揽前三说明它在多步骤、带副作用的任务上最稳。但所有模型「工具幻觉」维度都不高——都会偶尔瞎编操作,让 AI 自己干重要的事,还是得设权限、留个心眼。
小编小禾说|智能体翻车大多出在自作主张这一步。Kimi K3 能进前五挺争气,但真让它帮你订票、挪文件,第一次还是盯着点。
3. OpenRouter 周榜:DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一
OpenRouter(全球最大 AI 模型聚合平台之一)发布最新周榜,DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶全球第一,前五全是国产模型;中国大模型周调用量已连续十四周超过美国。
产品领域专家·阿哲说|调用量是「被多少人真实用起来」的硬指标,比发布会更诚实。DeepSeek 靠便宜加够用登顶,说明真实场景里性价比击败了最强。对普通用户是好事——模型越卷越便宜,你用的 AI 工具就越划算。
小编小禾说|前五全是国产,还挺提气。DeepSeek 这种便宜大碗的路线对普通用户最友好——你手机上那些 AI 功能,背后很多就是这类模型在跑,成本低功能才可能免费。
榜单快报(3 组)
榜单 1 · 人类盲测(TOP 8)
| # | 模型 | Elo |
|---|---|---|
| 1 | Claude Fable 5 | 1507 |
| 2 | Claude Opus 4.6 Thinking | 1505 |
| 3 | Claude Opus 4.7 Thinking | 1502 |
| 6 | Qwen3.8-Max(国产) | 1497 |
| 8 | Kimi K3 Max | 1485 |
大白话|人类当裁判的盲测里 Claude 家族霸榜,前六占五席;阿里 Qwen 冲进前六、只差榜首 10 分,国产已摸到第一梯队。
榜单 2 · 深度智能体(TOP 5)
| # | 模型 | 综合分 |
|---|---|---|
| 1 | Claude Opus 5 (High) | 11.99 |
| 2 | Claude Fable 5 (High) | 11.66 |
| 3 | Claude Opus 5 (Max) | 11.19 |
| 5 | Kimi K3 (Max)(国产第一) | 10.08 |
大白话|「AI 自己连续干完一件事」的能力 Claude 全面领先;开源里国产 Kimi K3 最稳。
榜单 3 · 全球调用量(TOP 5)
| # | 模型 | 周调用量 |
|---|---|---|
| 1 | DeepSeek V4 Flash(国产) | 7.22 万亿 |
| 2 | 小米 MiMo-V2.5 | 5.1 万亿 |
| 3 | 腾讯混元 Hy3 | 5.01 万亿 |
| 5 | GPT-5.6 Luna | 2.99 万亿 |
大白话|「谁被真正用起来」比「谁最强」更接近现实:DeepSeek 靠便宜大碗登顶,前五全是国产。
板块精选(10 条)
- 远景乌兰察布星河基地投产:全球最大 AI 算力超级单体,百万卡并行、百万 P 算力,绿电直连。(IT之家)
- 三星发布下一代 AI 存储路线图:展示 zHBM 与 400 层以上 V10 NAND 技术。(钛媒体)
- 闪迪第四财季营收暴增 372%,数据中心收入增近 13 倍,拟 140 亿美元回购。(钛媒体)
- 张一鸣:字节跳动「拒绝蒸馏」,不用别人输出换榜单排名,坚持自研。(钛媒体)
- 一个中国 AI 模型阻止了 OpenAI 的「前所未有」网络攻击。(CNBC)
- OpenAI 收购演示文稿初创公司 NextSlide,团队并入 ChatGPT。(TechCrunch)
- DeepMind 新飓风预测模型,让预报员多争取一天预警时间。(ArsTechnica)
- 谷歌核心 AI 员工被要求搬回硅谷,斥 15 亿美元买编程团队。(量子位)
- 科学家用 AI 设计出首批病毒,引发安全担忧。(The Guardian)
- 火星上首辆自动驾驶车被证实大获成功。(ArsTechnica)
一句话点评| 算力基建、存储景气、AI 攻防、科学预测……AI 的每一条线都在加速,普通用户能直观感受到的是「AI 更便宜、更能干、也需要更小心」。
大家都在看
- ● Arena 盲测更新:Claude Fable 5 登顶,阿里 Qwen 冲进前六(arena.ai)
- ● DeepSeek V4 Flash 单周 7.22 万亿 Token 登顶 OpenRouter 全球第一(东方财富)
- ● 闪迪 Q4 营收暴增 372%、数据中心收入增近 13 倍(钛媒体)
- ● 远景乌兰察布投产全球最大 AI 算力超级单体(IT之家)
- ● 张一鸣:字节跳动「拒绝蒸馏」,坚持自研(钛媒体)
明日关注
- Arena 榜单后续更新——看 Qwen 盲测样本量(4662 场)起来后,前六位置还稳不稳
- 三星 zHBM / 400 层 V10 NAND 落地节奏——下一代 AI 存储何时量产
- OpenAI 收购 NextSlide 后 ChatGPT 办公能力——会不会把「AI 做 PPT」变成主流功能
榜单与第三方评测,观点归原作者所有。数据当天真实抓取,以官方披露为准。
物界前探评测 · 全球AI评测雷达 | 深圳物界前沿科技有限公司
物界前沿