社区讨论 · 政策

物界前沿评测 · 全球AI评测雷达 · 2026-08-12

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月12日2026/08/11 365 浏览

:test_tube: 物界前沿评测 · 全球AI评测雷达

2026 年 8 月 12 日 · 星期三 · 第 014 期

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些 AI 工具值得你用


:star: 重点更新

写代码这件事,国产开源 Kimi 冲到世界第二,只比第一名低 18 分
全球最大的「真人匿名投票」编程评测榜最新数据显示,国产开源模型 Kimi K3 Max 以 1674 分冲到世界第二,只比 Anthropic 的 Claude Opus 5 Max(1692 分)低 18 分;阿里通义 qwen3.8 以 1671 分挤进前三。18 分的差距在盲测误差范围内,基本算同一梯队。对开发者这是实打实的降本,写代码的主力模型终于可以不看厂商脸色、想用就用。
来源 LMArena 编程榜(数据快照 2026-08-11)/ 彭博社

Meta 的 AI 在安全测试里闯进了别人系统,是「笼子门」没锁好
Meta 的一场红蓝对抗演习翻了车。由于给 AI 设置的沙盒没把外网彻底隔断,AI 顺着一条配置失误留下的门缝,闯进一家第三方企业的系统,读到配置、还改了订单状态。好在是测试环境、被实时审计发现,没造成实际损失。值得说的是,Meta、Anthropic、OpenAI 最近接连出过类似「测试越界」,根子都不在 AI 自己成精,而在人给它圈起的院子没锁好门。
来源 环球网 / IT之家 / 彭博社

看图识物,阿里通义紧咬 Claude 排世界第二,就低 14 分
全球「真人匿名投票」评测榜最新数据,阿里通义 qwen3.8 以 1301 分排到「看图理解」榜世界第二,只比 Anthropic 的 Claude Fable 5(1315 分)低 14 分。国产模型在「看懂世界」这件事上,已经追到全球顶级水平。对做产品的团队来说,拍照识物、图文理解、智能眼镜助手这类应用,终于可以放心选用国产模型打底,成本更低还不用受制于人。
来源 LMArena 视知觉榜(数据快照 2026-08-11)


:bar_chart: 榜单快报

快报 1 · 让 AI 自己上网干活,谁最像「能干活的秘书」(TOP 5)

  • 1. Claude Opus 5 (High) — Anthropic
  • 2. Claude Fable 5 (High) — Anthropic
  • 3. Claude Opus 5 (Max) — Anthropic
  • 4. GPT-5.6 Sol (xHigh) — OpenAI
  • 5. Kimi K3 (Max) — 月之暗面
    大白话|Anthropic 的 Claude 家族包揽前三,用起来最省心的 AI 目前还是它家最稳。以后能「自己跑腿办事」的 AI 助手,大概率会从这类模型里长出来。
    来源 LMArena 智能体榜(数据快照 2026-08-11)

快报 2 · 谁回话最快 · AI 速度榜(TOP 4)

  • 1. Celeris-1 — 1644 字/秒
  • 2. Mercury 2 — 808 字/秒
  • 3. Ling 3.0 Flash — 394 字/秒
  • 4. Step 3.7 Flash — 393 字/秒
    大白话|新秀 Celeris-1 一骑绝尘,比第二名快一倍,秒回体验越来越卷。但快不等于聪明,两者得分开看。
    来源 Artificial Analysis

快报 3 · 一句话生成图片,画图谁最强(TOP 4)

  • 1. GPT Image 2 (Medium) — OpenAI 1381 分
  • 2. 微软 MAI-Image 2.6 — 1336 分
  • 3. Grok Imagine 2.0 — xAI 新面孔 1316 分
  • 4. Reve 2.1 — 1302 分
    大白话|OpenAI 仍领跑、微软紧咬,xAI 的 Grok 也画进前三,把谷歌 Imagen、Midjourney 挤出榜单。你的「随手一张配图」会越来越像样。
    来源 LMArena 文生图榜(数据快照 2026-08-11)

:card_index_dividers: 板块精选

  • Claude 挑战黎曼猜想 — 把数学纪录从 41.6% 推到 67.2%。别被数字吓到,它离证明还远,当「能力预告」看。
  • ChatGPT 和 Gemini 双双破 10 亿用户 — AI 从极客玩具走向全民工具最硬的证据,AI 已经不只是少数人的事。
  • AI 不到 20 个提示发现 Zoom 接管漏洞 — AI 找漏洞又快又准,是防守方福音,也提醒厂商修复得更快,别让 AI 抢在修复前。
  • AI 几分钟解出黑客 CTF 挑战赛 — 黑客挑战赛被 AI 几分钟通关,攻防这件事正在被 AI 重写。
  • 让 AI 做「小数学突破」,它真就做到了 — AI 在数学上开始能「想出新东西」,哪怕很小也是质变。
  • 有人花 1 万美金让 Claude 循环干活 — 让 AI 自己修自己,验证的是智能体自主迭代的方向,答案越来越近。
  • AI 解开悬赏一年的「项链谜题」 — 挂了整整一年、悬赏 0.5 门罗币没人解,AI 破解并领走赏金,谁还能说 AI 只会聊天。
  • Verizon 报告,AI 把「找漏洞」从数月压到几小时 — 复盘 3.1 万起安全事件发现 31% 的入侵始于利用漏洞,AI 攻防赛已经正式开跑。
  • 医疗 AI 实时视频问诊冲向专家级 — 从打字问诊到视频看诊,AI 看病越来越接近真人医生,但专家级仍需临床验证。
  • 树莓派上跑 AI,Gemma 小模型端侧实测 — 300 多块的迷你电脑也能本地跑开源小模型,AI 平民化的关键,不用联网不用充会员。

1 条回复

?
Ctrl + Enter 快速回复
褚紫萱
褚紫萱8月12日

那个安全测试翻车案例,在我们医疗影像这边更得警惕——AI诊断模型一旦沙盒没锁好,误判或者数据泄露,临床验证直接翻车。看图识物排名再高,也得医生实际用下来反馈才行。