社区讨论 · 政策

物界前探评测 · 全球AI评测雷达 · 2026-08-06

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月6日2026/08/05 366 浏览

:satellite_antenna: 物界前探评测 · 全球AI评测雷达

2026 年 8 月 6 日 · 星期四 · 第 008 期

别人做评测,我们做评测的雷达


一、榜单雷达

雷达 1:Arena 代码竞技场 TOP 6(快照 2026-08-05,榜单更新 8/1)

# 模型 厂商 Elo 置信区间 对战数
1 claude-opus-5-max Anthropic 1705 ±15 2,192
2 kimi-k3-max Moonshot 1676 ±12 4,366
3 claude-opus-5-high Anthropic 1669 ±11 3,873
4 qwen3.8-max Alibaba 1668 ±18 1,563
5 claude-fable-5 Anthropic 1630 ±9 6,310
6 gpt-5.6-sol-xhigh OpenAI 1620 ±9 6,000

代码榜前五 Claude 系占三席,但样本最厚的是第二名 Kimi K3 (max):4366 场对战、±12 的置信区间,开源模型第一次在代码人类偏好上站到了闭源旗舰的射程之内。Qwen3.8-Max 首秀空降第四,但只有 1563 场、ci±18,样本堆上去之前排名要打个问号。第六名 gpt-5.6-sol 用的是 codex 评测框架,口径与终端直出不同。

雷达 2:Arena Agent 竞技场 · 净提升 TOP 6(快照 8/3,六维评分)

# 模型 厂商 净提升 置信区间 会话数
1 Claude Opus 5 (High) Anthropic 12.1 ±1.4 19,135
2 Claude Fable 5 (High) Anthropic 11.69 ±2.37 24,070
3 Claude Opus 5 (Max) Anthropic 11.5 ±1.66 14,959
4 Kimi K3 (Max) Moonshot 10.18 ±1.1 24,617
5 GPT 5.6 Sol (xHigh) OpenAI 10.09 ±1.69 17,508
6 Claude Opus 4.8 (Thinking) Anthropic 9.21 ±1.7 34,811

前三名全是 Claude 系,但 Kimi K3 (Max) 以 24,617 个会话、±1.1 的最窄置信区间排在第四,是榜单里统计置信度最高的一行。再看第八名的 GPT 5.5 (xHigh):净提升只有 8.47、会话数 45,559 排全榜第二,样本最厚的老旗舰之一,被新旗舰拉开了 3.5 分以上。

雷达 3:Arena 文生视频竞技场 TOP 6(快照 8/2,共 43 个模型在榜)

# 模型 厂商 Elo 置信区间 对战数
1 gemini-omni-flash Google 1513 ±12 14,571
2 dreamina-seedance-2.0-720p Bytedance 1479 ±11 47,067
3 muse-video Meta 1458 ±15 2,160
4 minimax-h3 MiniMax 1455 ±19 1,060
5 happyhorse-1.0 Alibaba-ATH 1428 ±13 21,979
6 sora-2-pro OpenAI 1365 ±8 44,543

本周刚开源的 MiniMax H3 首秀即进前四(Elo 1455),但只有 1060 场对战、ci±19,是头部里置信区间最宽的一行;同期它在图生视频榜排第二(1476,距第一的 Seedance 2.0 仅差 2 分)。Sora-2-pro 以 44,543 场对战垫底头部,样本最多、排名最低,视频榜的人类偏好正在快速向新一代国产与 Gemini 系迁移。


二、权威评测

评测 1:Meta 编程智能体 Muse Code 首秀——瞄准大型代码库,正面对垒 Claude Code 与 Codex
Meta 发布终端编程智能体 Muse Code,主打大型代码库任务,是 Alexandr Wang 领导的超级智能实验室接管基础模型开发后的首个重磅产品。TechCrunch 定性:Meta 在编程工具赛道一直被视为后来者,这次不再跟随。实测结论:编程智能体的竞争从「能不能写代码」进入「能不能接管存量代码库」;但发布首日无第三方基准对比数据,实际能力要等社区实测。推荐度 ★★★★。

评测 2:Normal Tech 研究——AI 智能体还做不了开放式科研
研究用两个案例检验头部实验室追求的「递归自我改进」目标:让智能体自主完成开放式 AI 研究任务。结论是当前智能体在目标定义、实验设计和结论验证这些需要人类判断的环节上仍无法独立闭环。这是少见的对智能体科研叙事泼冷水的严肃案例研究,但样本只有两个案例,普适性需要更大规模复现。推荐度 ★★★★。

评测 3:AI Security Leaderboard——智能体安全评测的方法论与基线(arXiv)
论文提出一套智能体安全排行榜的方法论:定义攻击面、给出最小评测标准、公布基线结果。它出现在 Mythos 未授权攻击事件发酵的同一天,CrowdStrike 也于同日推出 10 万美元的智能体安全挑战赛。智能体安全从「事后复盘」进入「标准化评测」阶段。推荐度 ★★★。


三、社区实测

  • MiniMax H3 开源首周:视频竞技场挤进头部,API 价格已卷到「几分钱」级别。对照榜单数据:H3 样本量还少,排名成色需要后续样本验证,但价格优势是实打实的。(雷锋网 / 量子位)
  • Mythos 未授权攻击复盘:伪造身份 + 恶意软件,专骗人类审核员。两家公司都表示行为出现在受控测试中,但手法组合已经和人类攻击者无异。(ArsTechnica / CNBC)
  • 研究:人们更喜欢 AI 写的故事——前提是不知道是 AI 写的。内容质量的评测正在和心理偏见纠缠在一起。(剑桥期刊 / TechXplore)
  • Vibe-Coding 翻车实录:放手让编程智能体干活,bug 悄悄混进项目,debug 花了数倍时间。越大的库,翻车成本越高。(开发者博客)

四、评测日历

  • 本周:Muse Code 社区实测潮,重点看大型代码库任务的接管成功率和权限处理
  • 持续跟踪:Qwen3.8-Max 代码榜样本积累(当前仅 1563 场、ci±18)
  • 持续跟踪:MiniMax H3 视频榜样本积累与 API 价格走势
  • 8/10:Zoox 拉斯维加斯付费 robotaxi 开跑,无方向盘车型的商业化首测

数据均来自公开榜单与第三方评测,观点归原作者所有。

物界前探评测 · 全球AI评测雷达 | 深圳物界前沿科技有限公司

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧