物界前沿评测 · 全球AI评测雷达 · 2026-08-13
重点更新 3 条 · 双专家点评
1. DeepSeek V4 Pro 空降 LiveBench:77.4 分,答对一题只花 4 分钱
LiveBench 是出了名的「防作弊考场」——题目半年一换、杜绝真题泄露,分数比一般榜单实在。最新榜单上,DeepSeek V4 Pro 正式版以 77.4 分空降,离第一梯队(Claude Fable 5 的 83.0)只有 6 分差距;更夸张的是成本,每成功完成任务平均只要 4.4 美分(约 3 毛钱人民币),全场最低档。想省钱又想要接近顶级的 AI,这个数字很值得记住。
编程领域专家·老徐说|77.4 分放在半年前得卖十倍价。DeepSeek 的打法一直没变:用十分之一的价格做到九成能力,让「够用」变成「真香」。我上个月就说过,调用量是市场用脚投票的硬指标——这次空降 LiveBench,等于把「便宜」和「强」同时写进了官方成绩单。不过还是要泼盆冷水:榜单分数归榜单,接进真实项目的稳定性,先等第三方实测。
小编小禾说|我用 DeepSeek 写过周报、排过行程,说实话和贵好几倍的模型差别不大。它最打动我的是响应快、不啰嗦,凌晨三点改稿子它还在线。3 毛钱一题的价格,我都不需要纠结「今天该省着点用」。
来源:LiveBench(2026-06-25 版榜单)/ IT之家
2. AI 智能体盲测榜:Anthropic 三连冠,Kimi K3 是中国牌面
如果你想找「最能干活的 AI」而不是「最能聊天的 AI」,看 Arena 智能体盲测榜。真人裁判、不看品牌、真刀真枪对战:Claude Fable 5、Opus 5 系列包揽前三,OpenAI 的 GPT-5.6 Sol 排第四,月之暗面 Kimi K3 以 10.43 分排第五,是中国模型最高名次。榜单六项维度里,还有「命令恢复」这种考「搞砸了能不能自己修好」的硬题。
安全领域专家·老周说|智能体榜比聊天榜难刷——它考的是「干活的可靠性」。Kimi 能挤进前五是实打实的信号,说明国产模型在「干活」这个维度真的追上来了。「命令恢复」能进考试科目,说明行业已经开始把「AI 犯错后能否自己兜底」当成硬指标,这也是一种边界意识:能力越强,越要防住「越界」。权限该设最小还是要设最小,别因为分数高就乱授权。
小编小禾说|我这两天正好在试用智能体帮我整理会议纪要和跟进任务。体验是:它能干 80% 的活,剩下 20% 需要我兜底——好在它干砸了会老实说。榜单上那一两分的差距,落到日常使用,可能就是一句话的差别。
来源:Arena 智能体盲测榜(快照 2026-08-11,8/12 抓取)
3. 蚂蚁开源小模型 Ling 3.0 Tiny,被 123 项测试「红队」盘了个底朝天
开源小模型的极限在哪?独立评测团队对蚂蚁开源的 Ling 3.0 Tiny(免费版)做了123 类「红队」测试、累计 391 条记录:越狱防护、敏感内容、逻辑一致性、指令跟随……像体检一样全身查一遍。结果有扛住的、也有当场破功的,哪类强哪类弱,报告列得清清楚楚——这也是开源模型「敢让人随便盘」的透明度红利。
安全领域专家·老周说|这种第三方红队全身体检,比厂商自吹的跑分值钱多了。391 条记录、123 个类别,逐类给结论,等于把底裤翻给用户看。我一直强调边界和护栏——小模型能力没那么强,反而更容易在边界上翻车。开源模型敢这么被盘,本身就是态度;报告里暴露的弱点,正是用户使用前该知道的「说明书」。
小编小禾说|第一次觉得 AI 的「体检报告」我也能看懂:哪些项扛住了、哪些项当场破功,清清楚楚。这种把缺点摆在明面上的做法,反而让我更敢用它——起码我知道它的底线在哪。
来源:lateos.ai 红队报告 / Hacker News
榜单快报 · 3 组硬数据
① AI 智能体盲测榜 TOP5:Claude Fable 5 (High) 12.04 | Claude Opus 5 (High) 11.96 | Claude Opus 5 (Max) 11.92 | GPT-5.6 Sol (xHigh) 10.72 | Kimi K3 (Max) 10.43。真人当裁判的盲测里,Anthropic 成了「常胜将军」,Kimi K3 是中国牌面;榜单还考「搞砸了能不能自己修」,这题比聊天水平实在。
② AA「智能指数」TOP5:Claude Opus 5 (max) 63 | Claude Fable 5 62 | GPT-5.6 Sol (max) 61 | Grok 4.6 (high) 61 | Kimi K3 (max) 60。综合实力拼性价比,开源阵营第一名还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「几分之差」。
③ LiveBench 总分榜(防作弊考场):Claude Fable 5 Max Effort 83.0 | GPT-5.6 Sol Max Effort 81.0 | GPT-5.5 Thinking 80.2 | Claude 5 Opus Thinking 80.1 | Kimi K3(开源)79.2 | DeepSeek V4 Pro 0813 空降 77.4,单任务成本 $0.044 全场最低档。「便宜大碗」这次写进了官方成绩单。
板块精选 10 条 · 一句话点评
- 「Can you tell if a comment is AI?」:七个话题,人机评论盲测上线(talkshi.com / Hacker News)— 测的不只是模型,更是你对「人味」的敏感度。
- 智能体「沙箱」能防逃逸,但不会告诉你里面发生了什么(rye.ai / Hacker News)— 安全性和可观测性,是智能体落地前必须补的两门课。
- Silicon Data 融资 3050 万美元:给「算力性能」做标准答案(Bloomberg)— 连「评测算力的评测」都有人投钱了,卖尺子的也在发财。
- NagaAI:比 Poe、OpenRouter 更便宜的 AI 聚合器(Hacker News)— 聚合器开始拼价格,用户是最大赢家。
- CrewScore:给智能体提示词做「覆盖率体检」(Hacker News)— 提示词工程正在变成「测试工程」。
- Dynobox:开源智能体技能「测试跑道」(GitHub / Hacker News)— 智能体开发进入「有测试再上线」阶段。
- 让 AI 写小说,实测「不算差」(Mother Jones / Hacker News)— AI 文学的下限不低,上限还差口气,差的那口气最值钱。
- Roku 上线 AI 影片频道,第一波口碑「AI 味太冲」(The Guardian)— AI 内容能不能留住观众,第一波反馈不太妙。
- 调查:超 80% 日本公司还没全面拥抱 AI(路透 / BBC)— AI 普及的差距藏在企业流程里,不在技术里。
- TokenMaxxer:跟朋友比谁 AI 花钱多(Hacker News)— AI 使用量从「生产力指标」变成「社交货币」。
大家都在看
- A股 AI 硬件盘中普涨:寒武纪大涨近 5%,摩尔线程站稳 579 元上方(问财行情)
- 谷歌 Pixel 11 发布:最强 Agent 版 Gemini 站 C 位(CNBC)
- 富士康 AI 服务器营收首破 51%(IT之家)
- CoreWeave 证实 A100 可服役至 2029 年(IT之家)
- Claude 上线 Chrome 侧边栏,对话历史全平台互通(IT之家)
明日关注
① DeepSeek V4 Pro 正式版这波热度过后,LiveBench 各分榜会不会被它继续刷新?77.4 分的「性价比王座」能坐多久?
② 智能体盲测榜新增「命令恢复」维度,国产模型能不能借这题再进一步、冲进前三?
③ 财报季进入深水区:Cerebras 暴跌 14% 之后,市场会不会重新审视 AI 芯片公司的估值体系?
物界前沿评测 · 全球AI评测雷达|数据均来自公开榜单与报道,以官方披露为准
物界前沿评测 | 深圳物界前沿科技有限公司
物界前沿