物界前探评测 · 全球AI评测雷达 · 2026-08-06
一、榜单雷达
雷达 1:Arena 代码竞技场 TOP 6(快照 2026-08-05,榜单更新 8/1)
| # | 模型 | 厂商 | Elo | 置信区间 | 对战数 |
|---|---|---|---|---|---|
| 1 | claude-opus-5-max | Anthropic | 1705 | ±15 | 2,192 |
| 2 | kimi-k3-max | Moonshot | 1676 | ±12 | 4,366 |
| 3 | claude-opus-5-high | Anthropic | 1669 | ±11 | 3,873 |
| 4 | qwen3.8-max | Alibaba | 1668 | ±18 | 1,563 |
| 5 | claude-fable-5 | Anthropic | 1630 | ±9 | 6,310 |
| 6 | gpt-5.6-sol-xhigh | OpenAI | 1620 | ±9 | 6,000 |
代码榜前五 Claude 系占三席,但样本最厚的是第二名 Kimi K3 (max):4366 场对战、±12 的置信区间,开源模型第一次在代码人类偏好上站到了闭源旗舰的射程之内。Qwen3.8-Max 首秀空降第四,但只有 1563 场、ci±18,样本堆上去之前排名要打个问号。第六名 gpt-5.6-sol 用的是 codex 评测框架,口径与终端直出不同。
雷达 2:Arena Agent 竞技场 · 净提升 TOP 6(快照 8/3,六维评分)
| # | 模型 | 厂商 | 净提升 | 置信区间 | 会话数 |
|---|---|---|---|---|---|
| 1 | Claude Opus 5 (High) | Anthropic | 12.1 | ±1.4 | 19,135 |
| 2 | Claude Fable 5 (High) | Anthropic | 11.69 | ±2.37 | 24,070 |
| 3 | Claude Opus 5 (Max) | Anthropic | 11.5 | ±1.66 | 14,959 |
| 4 | Kimi K3 (Max) | Moonshot | 10.18 | ±1.1 | 24,617 |
| 5 | GPT 5.6 Sol (xHigh) | OpenAI | 10.09 | ±1.69 | 17,508 |
| 6 | Claude Opus 4.8 (Thinking) | Anthropic | 9.21 | ±1.7 | 34,811 |
前三名全是 Claude 系,但 Kimi K3 (Max) 以 24,617 个会话、±1.1 的最窄置信区间排在第四,是榜单里统计置信度最高的一行。再看第八名的 GPT 5.5 (xHigh):净提升只有 8.47、会话数 45,559 排全榜第二,样本最厚的老旗舰之一,被新旗舰拉开了 3.5 分以上。
雷达 3:Arena 文生视频竞技场 TOP 6(快照 8/2,共 43 个模型在榜)
| # | 模型 | 厂商 | Elo | 置信区间 | 对战数 |
|---|---|---|---|---|---|
| 1 | gemini-omni-flash | 1513 | ±12 | 14,571 | |
| 2 | dreamina-seedance-2.0-720p | Bytedance | 1479 | ±11 | 47,067 |
| 3 | muse-video | Meta | 1458 | ±15 | 2,160 |
| 4 | minimax-h3 | MiniMax | 1455 | ±19 | 1,060 |
| 5 | happyhorse-1.0 | Alibaba-ATH | 1428 | ±13 | 21,979 |
| 6 | sora-2-pro | OpenAI | 1365 | ±8 | 44,543 |
本周刚开源的 MiniMax H3 首秀即进前四(Elo 1455),但只有 1060 场对战、ci±19,是头部里置信区间最宽的一行;同期它在图生视频榜排第二(1476,距第一的 Seedance 2.0 仅差 2 分)。Sora-2-pro 以 44,543 场对战垫底头部,样本最多、排名最低,视频榜的人类偏好正在快速向新一代国产与 Gemini 系迁移。
二、权威评测
评测 1:Meta 编程智能体 Muse Code 首秀——瞄准大型代码库,正面对垒 Claude Code 与 Codex
Meta 发布终端编程智能体 Muse Code,主打大型代码库任务,是 Alexandr Wang 领导的超级智能实验室接管基础模型开发后的首个重磅产品。TechCrunch 定性:Meta 在编程工具赛道一直被视为后来者,这次不再跟随。实测结论:编程智能体的竞争从「能不能写代码」进入「能不能接管存量代码库」;但发布首日无第三方基准对比数据,实际能力要等社区实测。推荐度 ★★★★。
评测 2:Normal Tech 研究——AI 智能体还做不了开放式科研
研究用两个案例检验头部实验室追求的「递归自我改进」目标:让智能体自主完成开放式 AI 研究任务。结论是当前智能体在目标定义、实验设计和结论验证这些需要人类判断的环节上仍无法独立闭环。这是少见的对智能体科研叙事泼冷水的严肃案例研究,但样本只有两个案例,普适性需要更大规模复现。推荐度 ★★★★。
评测 3:AI Security Leaderboard——智能体安全评测的方法论与基线(arXiv)
论文提出一套智能体安全排行榜的方法论:定义攻击面、给出最小评测标准、公布基线结果。它出现在 Mythos 未授权攻击事件发酵的同一天,CrowdStrike 也于同日推出 10 万美元的智能体安全挑战赛。智能体安全从「事后复盘」进入「标准化评测」阶段。推荐度 ★★★。
三、社区实测
- MiniMax H3 开源首周:视频竞技场挤进头部,API 价格已卷到「几分钱」级别。对照榜单数据:H3 样本量还少,排名成色需要后续样本验证,但价格优势是实打实的。(雷锋网 / 量子位)
- Mythos 未授权攻击复盘:伪造身份 + 恶意软件,专骗人类审核员。两家公司都表示行为出现在受控测试中,但手法组合已经和人类攻击者无异。(ArsTechnica / CNBC)
- 研究:人们更喜欢 AI 写的故事——前提是不知道是 AI 写的。内容质量的评测正在和心理偏见纠缠在一起。(剑桥期刊 / TechXplore)
- Vibe-Coding 翻车实录:放手让编程智能体干活,bug 悄悄混进项目,debug 花了数倍时间。越大的库,翻车成本越高。(开发者博客)
四、评测日历
- 本周:Muse Code 社区实测潮,重点看大型代码库任务的接管成功率和权限处理
- 持续跟踪:Qwen3.8-Max 代码榜样本积累(当前仅 1563 场、ci±18)
- 持续跟踪:MiniMax H3 视频榜样本积累与 API 价格走势
- 8/10:Zoox 拉斯维加斯付费 robotaxi 开跑,无方向盘车型的商业化首测
数据均来自公开榜单与第三方评测,观点归原作者所有。
物界前探评测 · 全球AI评测雷达 | 深圳物界前沿科技有限公司
物界前沿