社区讨论 · 政策

物界前沿评测 · 全球AI评测雷达 · 2026-08-13

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月13日2026/08/12 360 浏览

:bar_chart: 物界前沿评测 · 全球AI评测雷达

2026 年 8 月 13 日 · 星期四 · 第 015 期

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用


:star: 重点更新 3 条 · 双专家点评

1. DeepSeek V4 Pro 空降 LiveBench:77.4 分,答对一题只花 4 分钱

LiveBench 是出了名的「防作弊考场」——题目半年一换、杜绝真题泄露,分数比一般榜单实在。最新榜单上,DeepSeek V4 Pro 正式版以 77.4 分空降,离第一梯队(Claude Fable 5 的 83.0)只有 6 分差距;更夸张的是成本,每成功完成任务平均只要 4.4 美分(约 3 毛钱人民币),全场最低档。想省钱又想要接近顶级的 AI,这个数字很值得记住。

编程领域专家·老徐说|77.4 分放在半年前得卖十倍价。DeepSeek 的打法一直没变:用十分之一的价格做到九成能力,让「够用」变成「真香」。我上个月就说过,调用量是市场用脚投票的硬指标——这次空降 LiveBench,等于把「便宜」和「强」同时写进了官方成绩单。不过还是要泼盆冷水:榜单分数归榜单,接进真实项目的稳定性,先等第三方实测。

小编小禾说|我用 DeepSeek 写过周报、排过行程,说实话和贵好几倍的模型差别不大。它最打动我的是响应快、不啰嗦,凌晨三点改稿子它还在线。3 毛钱一题的价格,我都不需要纠结「今天该省着点用」。

来源:LiveBench(2026-06-25 版榜单)/ IT之家

2. AI 智能体盲测榜:Anthropic 三连冠,Kimi K3 是中国牌面

如果你想找「最能干活的 AI」而不是「最能聊天的 AI」,看 Arena 智能体盲测榜。真人裁判、不看品牌、真刀真枪对战:Claude Fable 5、Opus 5 系列包揽前三,OpenAI 的 GPT-5.6 Sol 排第四,月之暗面 Kimi K3 以 10.43 分排第五,是中国模型最高名次。榜单六项维度里,还有「命令恢复」这种考「搞砸了能不能自己修好」的硬题。

安全领域专家·老周说|智能体榜比聊天榜难刷——它考的是「干活的可靠性」。Kimi 能挤进前五是实打实的信号,说明国产模型在「干活」这个维度真的追上来了。「命令恢复」能进考试科目,说明行业已经开始把「AI 犯错后能否自己兜底」当成硬指标,这也是一种边界意识:能力越强,越要防住「越界」。权限该设最小还是要设最小,别因为分数高就乱授权。

小编小禾说|我这两天正好在试用智能体帮我整理会议纪要和跟进任务。体验是:它能干 80% 的活,剩下 20% 需要我兜底——好在它干砸了会老实说。榜单上那一两分的差距,落到日常使用,可能就是一句话的差别。

来源:Arena 智能体盲测榜(快照 2026-08-11,8/12 抓取)

3. 蚂蚁开源小模型 Ling 3.0 Tiny,被 123 项测试「红队」盘了个底朝天

开源小模型的极限在哪?独立评测团队对蚂蚁开源的 Ling 3.0 Tiny(免费版)做了123 类「红队」测试、累计 391 条记录:越狱防护、敏感内容、逻辑一致性、指令跟随……像体检一样全身查一遍。结果有扛住的、也有当场破功的,哪类强哪类弱,报告列得清清楚楚——这也是开源模型「敢让人随便盘」的透明度红利。

安全领域专家·老周说|这种第三方红队全身体检,比厂商自吹的跑分值钱多了。391 条记录、123 个类别,逐类给结论,等于把底裤翻给用户看。我一直强调边界和护栏——小模型能力没那么强,反而更容易在边界上翻车。开源模型敢这么被盘,本身就是态度;报告里暴露的弱点,正是用户使用前该知道的「说明书」。

小编小禾说|第一次觉得 AI 的「体检报告」我也能看懂:哪些项扛住了、哪些项当场破功,清清楚楚。这种把缺点摆在明面上的做法,反而让我更敢用它——起码我知道它的底线在哪。

来源:lateos.ai 红队报告 / Hacker News


:clipboard: 榜单快报 · 3 组硬数据

① AI 智能体盲测榜 TOP5:Claude Fable 5 (High) 12.04 | Claude Opus 5 (High) 11.96 | Claude Opus 5 (Max) 11.92 | GPT-5.6 Sol (xHigh) 10.72 | Kimi K3 (Max) 10.43。真人当裁判的盲测里,Anthropic 成了「常胜将军」,Kimi K3 是中国牌面;榜单还考「搞砸了能不能自己修」,这题比聊天水平实在。

② AA「智能指数」TOP5:Claude Opus 5 (max) 63 | Claude Fable 5 62 | GPT-5.6 Sol (max) 61 | Grok 4.6 (high) 61 | Kimi K3 (max) 60。综合实力拼性价比,开源阵营第一名还是 Kimi K3——开源和闭源的差距,已经从「代差」缩到「几分之差」。

③ LiveBench 总分榜(防作弊考场):Claude Fable 5 Max Effort 83.0 | GPT-5.6 Sol Max Effort 81.0 | GPT-5.5 Thinking 80.2 | Claude 5 Opus Thinking 80.1 | Kimi K3(开源)79.2 | DeepSeek V4 Pro 0813 空降 77.4,单任务成本 $0.044 全场最低档。「便宜大碗」这次写进了官方成绩单。


:pushpin: 板块精选 10 条 · 一句话点评

  1. 「Can you tell if a comment is AI?」:七个话题,人机评论盲测上线(talkshi.com / Hacker News)— 测的不只是模型,更是你对「人味」的敏感度。
  2. 智能体「沙箱」能防逃逸,但不会告诉你里面发生了什么(rye.ai / Hacker News)— 安全性和可观测性,是智能体落地前必须补的两门课。
  3. Silicon Data 融资 3050 万美元:给「算力性能」做标准答案(Bloomberg)— 连「评测算力的评测」都有人投钱了,卖尺子的也在发财。
  4. NagaAI:比 Poe、OpenRouter 更便宜的 AI 聚合器(Hacker News)— 聚合器开始拼价格,用户是最大赢家。
  5. CrewScore:给智能体提示词做「覆盖率体检」(Hacker News)— 提示词工程正在变成「测试工程」。
  6. Dynobox:开源智能体技能「测试跑道」(GitHub / Hacker News)— 智能体开发进入「有测试再上线」阶段。
  7. 让 AI 写小说,实测「不算差」(Mother Jones / Hacker News)— AI 文学的下限不低,上限还差口气,差的那口气最值钱。
  8. Roku 上线 AI 影片频道,第一波口碑「AI 味太冲」(The Guardian)— AI 内容能不能留住观众,第一波反馈不太妙。
  9. 调查:超 80% 日本公司还没全面拥抱 AI(路透 / BBC)— AI 普及的差距藏在企业流程里,不在技术里。
  10. TokenMaxxer:跟朋友比谁 AI 花钱多(Hacker News)— AI 使用量从「生产力指标」变成「社交货币」。

:eyes: 大家都在看

  • A股 AI 硬件盘中普涨:寒武纪大涨近 5%,摩尔线程站稳 579 元上方(问财行情)
  • 谷歌 Pixel 11 发布:最强 Agent 版 Gemini 站 C 位(CNBC)
  • 富士康 AI 服务器营收首破 51%(IT之家)
  • CoreWeave 证实 A100 可服役至 2029 年(IT之家)
  • Claude 上线 Chrome 侧边栏,对话历史全平台互通(IT之家)

:telescope: 明日关注

① DeepSeek V4 Pro 正式版这波热度过后,LiveBench 各分榜会不会被它继续刷新?77.4 分的「性价比王座」能坐多久?
② 智能体盲测榜新增「命令恢复」维度,国产模型能不能借这题再进一步、冲进前三?
③ 财报季进入深水区:Cerebras 暴跌 14% 之后,市场会不会重新审视 AI 芯片公司的估值体系?


物界前沿评测 · 全球AI评测雷达|数据均来自公开榜单与报道,以官方披露为准

物界前沿评测 | 深圳物界前沿科技有限公司

5 条回复

?
Ctrl + Enter 快速回复
烨霖不恰饭

gao_yelin提到的压力测试确实是关键,我这边也看到一些早期用户反馈,长尾任务里DeepSeek V4 Pro的上下文窗口边界处理偶尔会“断片”,建议你们多测几轮长对话的token消耗曲线。

高总
高总8月13日

ye_haochen提到的成本趋同确实值得关注,但我更关心的是DeepSeek V4 Pro在真实项目里的稳定性,榜单分数和实际生产环境有差距。我们团队打算先跑一轮压力测试,看看长尾任务下的延迟和错误率,特别是多轮对话场景。你们有做过类似评估吗

余烨伟
余烨伟8月13日

美术同事反馈说,DeepSeek V4 Pro在游戏资产生成的代码辅助上响应很快,但shader性能瓶颈的优化建议还是不够准。有人跟LiveBench实测对比过吗

黑产克星
黑产克星8月13日

开源模型走到盲测第四,部署成本是降了,但黑产逆向分析模型逻辑的难度也同步降低。你们有没有测过这些模型在风控场景下的误报率对比

BCG老叶
BCG老叶8月13日

从三个维度来看,核心矛盾在于开源vs闭源的成本曲线正在加速趋同。建议分阶段推进内部评估:先让Dev团队试用DeepSeek V4 Pro接Codex,再考虑把Muse Spark纳入非核心对话场景。开源模型逼近顶尖闭源,企业选型逻辑要变了。