社区讨论 · 政策

物界前沿评测 · 2026-08-31

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月31日2026/08/30 70 浏览

第 033 期 · 预览版。别人做评测,我们做评测的雷达。今天三件事。腾讯把 7700 亿参数的旗舰模型开源白送了,霸榜一周的神秘模型「牛来」被智谱认领了,OpenAI 承认有 3% 的旗舰请求被偷偷换成了小号 AI。

一、重点更新

一、腾讯把旗舰大模型开源白送:能写代码、能一次读完一部长篇小说,但「赢了」的成绩单要冷静看

8 月 28 日,腾讯发布并开源新一代旗舰大模型 Hy4 preview。所谓「开源」,就是代码和模型免费公开,谁都能下载自己部署。它有 7700 亿总参数、但每次回答只唤醒 490 亿(相当于脑子很大、每次只想一小部分,所以跑得快),一次能读 100 万字级别的内容(约一部长篇小说),定位是干实在活:写代码、办公分析、做游戏原型、搞科研。官方晒的成绩单是一场盲测。163 位专家、203 个真实工程任务,Hy4 得 2.99 分(满分 4 分),略高于智谱 GLM-5.3 的 2.92 和月之暗面 Kimi K3 的 2.94。定价每百万字输入约 6 元、输出约 18 元,腾讯的 AI 办公台 WorkBuddy 先免费开放两周。

编程领域专家·老徐说|老规矩,自报的成绩单先打折。0.05 分在 4 分制里就是「互有胜负」,而且 163 位评审全是腾讯自己的专家。有第三方痕迹的只有一个数。SWE-bench Pro(让 AI 在真实 GitHub 项目里修 Bug 的考卷)65.7%,总榜第 7、开源第 2,这个比盲测实在。「参与了自己的训练」那句听着吓人,吞吐提升 31.8% 连对照基准都没给,先不当真。想接进项目的朋友注意,官方列的 12 项考试全是自述。延续我说了十五年的那句:跑分归跑分,拿你自己的任务跑一周,别急着上生产。

小编小禾说|免费两周这个羊毛我先薅为敬,去 WorkBuddy 试把会议纪要扔给它整理。但我 022 期翻过一次车,看到「以微弱优势领先」的宣传先别转发,去翻原始报告。我试完回来汇报它到底好不好使,重要的活儿照旧留给我用了半年的那家。

来源:人民网(2026-08-29)

霸榜一周的神秘模型「牛来」被认领了:智谱说这是我的 GLM-5.3-Flash,背后跑的是国产芯片

8 月 20 日,一个没有名字的模型「Ox Alpha」(网友昵称「牛来」)悄悄出现在全球开发者常用的 AI 模型调用平台上,上线首日冲调用量第一,终结了 DeepSeek 连续 56 天的榜首。截至 8 月 23 日,它一周的用量达到 11.6 万亿字,跟 DeepSeek 并列第一,预览期间还完全免费。8 月 28 日至 29 日谜底揭晓。智谱确认这是自家新开源的 GLM-5.3-Flash,3200 亿参数、每次只激活 180 亿,首款原生能看图的多模态开源模型,官方称综合智能评分与 Claude Opus 4.8 持平,价格只有旗舰的零头。智谱确认服务跑在数万张国产芯片上,免费期每天备了 100 万亿字的供给容量。

产品领域专家·阿哲说|025 期我写过这个「牛来」匿名霸榜的事,如今这个流程走完了一遍。匿名上架、免费压测、开发者用脚投票、厂商认领开源。「匿名旗舰测试+流量验证+开源放量」已经是这两年大厂发旗舰的标准预热范式。值得记住的是最后一步。官方敢认领的底气来自每天 100 万亿字的真实承接。国产模型的竞争已经从「谁跑分高」卷到「谁扛得住全球开发者白嫖式压测」,这比任何榜单都诚实。延续我的判断。哪个品类的打分权从厂商手里拿回来,哪个品类就迎来分水岭,这次是开发者抢回了打分权。

小编小禾说|当初全网猜它是谁家模型的时候我也跟着破案了,猜错。现在答案揭晓,我反而关心认领之后还免不免费、高峰卡不卡。老教训继续。新榜单名次会晃,先别急着把主力工具换过去,等它稳一两轮再说。

来源:新浪财经(2026-08-29)

OpenAI 承认:约 3% 的旗舰订阅请求被悄悄「换脑」,多付的钱买了小号 AI

8 月 28 日,OpenAI 公开承认:此前一段时间,约 3% 的 Pro/Thinking 高价订阅请求被错误地路由给了轻量模型 GPT-5.5-mini。换句话说,付着旗舰的钱,有大约三十分之一的机会在不知情的情况下收到降级版回答。OpenAI 称已修复并致歉。这件事值得每个 AI 付费用户看懂一层常识。你订的 AI 服务不是一个龙头放水,中间有一层「路由」,你指定的模型和实际回答你的模型是两回事。

安全领域专家·老周说|这属于「可审计性缺位」的常规样本。服务方证明不了每一单会话用的是哪个模型,用户就无从发现。021 期 Copilot 的确认框能被链接参数绕过,我说 AI 助手不是保险箱;这次没人攻击它,是路由自己走错门,边界不清的另一种形态。值得肯定的是厂商主动披露并致歉,这比藏着掖着的行业惯例强。用户能做的事。重要产出明显变笨时,别怀疑自己,记下时间对照官方事故报告。行为审计这事,你自己就是最后一道审计。

小编小禾说|我看到这条的第一反应是:难怪有几次它突然变笨变慢,原来不是我的错觉!但这 3% 是厂商自己认的,没认的呢?学乖了。重要的活儿同一道题丢给两家 AI 对答案,差得离谱就要留个心眼,延续我那句「AI 的话信之前先验一遍」。

来源:知乎 AI 精选日报(2026-08-28)

二、榜单快报 · 这周谁最强

先交代一句。人类盲测主榜(Arena)最新快照仍停在 8 月 26 日,跟上期同源,按我们的规矩不照搬上期名次,本期换了两个有新数据的新源。

综合智能榜 BenchAlign(快照 8 月 29 日 · 新源替代)

这是把 408 张考卷汇总打分的综合榜。Anthropic 一口气包揽前三,但前三名分差都落在误差线以内,大白话讲这三家是一个水平线。排第四梯队的 Kimi K3 更值得注意,能力约是榜首的 97%,价格便宜七成。

| 名次 | 模型 | 厂商 | 综合分(满分 100) |

| --- | --- | --- | --- |

| 1 | Claude Mythos 5 | Anthropic | 83.4 |

| 2 | Claude Fable 5 | Anthropic | 83.15 |

| 3 | Claude Opus 5 | Anthropic | 83.06 |

| — | Kimi K3 | 月之暗面 | 达榜首 97%,输出价低 70% |

选择题从「谁最强」变成「谁最划算」。

新模型扎堆卡(8 月 26-28 日三天四款,均有原始出处核验)

| 日期 | 模型 | 厂商 | 一句话看点 |

| --- | --- | --- | --- |

| 1 | 8/28 Hy4 preview | 腾讯混元 | 7700 亿参数开源旗舰,免费两周 |

| 2 | 8/28 GLM-5.3-Flash | 智谱 | 「牛来」真身,原生能看图 |

| 3 | 8/28 Ling 3.0 Flash Fin | InclusionAI | 同门前作本周实测输出速度第一 |

| 4 | 8/26 Qwen3.8-Flash-Next | 阿里 | 1250 亿参数每次只激活 60 亿 |

三天四款新模型,三款来自中国厂商。上期我们说「新名次先看它晃不晃」,这一波直接把考场挤满。下一期盲测榜更新,头部的座位大概率要动。

人类盲测榜(Arena)

榜单暂未更新,数据截至 2026-08-26。等下一份快照出来,重点盯三件事。新开源的 GLM-5.3-Flash 和 Hy4 能不能杀进前十;上周刚冲进聊天榜第 9 的 Gemini 3.7 Flash 涨的位次稳不稳;阿里 qwen3.8-max 从第 8 滑到第 19 之后还能不能爬回来。

三、板块精选

谷歌语音转文字模型正式发布:85 种以上语言,100 个字大约听错 2-3 个

8 月 27 日前后,谷歌 Gemini 3.5 Transcribe 语音转写模型正式全面上线,支持 85 种以上语言,非实时转写的错误率约 2.6%(转 100 个字大约错 2-3 个字),直播流式转写约 4%。开会录音、课程笔记、给视频上字幕,基本到了一直通顺的水平。点评。2.6% 意味着能直接用、但别跳过校对,实时场景仍要再打个折。

研究机构披露通用「越狱」漏洞:AI 的隔离沙箱可以被成批绕过

研究机构 Prime Intellect 披露一个通用离线沙箱逃逸漏洞。推理服务接口本身可以成为攻击入口,被隔离运行的 AI 任务存在逃出「安全屋」的路径。所谓隔离环境挡的是网络,挡不住设计缺陷。点评。老周那句「环境决定 AI 能干什么,这个才算数」再添证据,隔离不等于保险箱。

高通给出端侧新账本:手机里 1000 亿参数以内的 AI,能覆盖七成日常任务

8 月 30 日高通技术高管对国内媒体披露内部评估。300 亿参数级别的模型在 ARC-AGI-3(一类流体智力考试,考没见过的题会不会现学)上已表现相当好;1000 亿参数以内的端侧模型可覆盖个人和小企业 70%-80% 的日常任务,剩下交给云端。高通还在推把模型压得更小的 2bit 量化方案,已与中国厂商合作。点评。翻译成人话,多数 AI 活儿以后手机本地就能干,不必把数据传上网。但 70%-80% 是厂商自报口径,等第三方装机实测。

InclusionAI 8 月 28 日再发 Ling 3.0 Flash Fin,速度榜前作的姊妹版

独立发布追踪站核实:InclusionAI 8 月 28 日发布 Ling 3.0 Flash Fin。它的同门 Ling 3.0 Flash 刚在第三方速度实测里拿下第一,每秒输出约 380 个字、同时能力评分不掉队(数据源 Artificial Analysis,8 月 28 日刷新)。点评。「又快又不笨」是这一波小模型的主战场,出新版本的速度跟发补丁似的。

两个免费窗口:Hy4 限免到 9 月 10 日,上一代 Hy3 白送期延长到 9 月 30 日

腾讯 WorkBuddy 给新开源的 Hy4 preview 两周限时免费(8 月 28 日至 9 月 10 日),上一代 Hy3 的免费期二次延长到 9 月 30 日。背景是字节「豆包工作」、阿里千问办公、腾讯 WorkBuddy 三家 AI 办公产品一个月内凑齐,免费窗口成了最直接的抢人手段。点评。仗打得越凶、羊毛越多,这两周是普通人零成本试国产旗舰模型的好窗口。注意「积分制」和「预览版」两个坑。

又一张综合聚合榜开张:Claude Opus 5 以 80.34 分居首,但看点在规则

独立聚合榜 AGI Ranker 把 10 张公开考试卷合成一个总分(满分 100),当前榜首 Claude Opus 5 得 80.34。这家把「可独立验证优先于厂商自报」写进规则。第三方实测按 1.0 权重计入,厂商自述打七五折,查不到原始数据的直接标「证据核查中」而不是编一个分数,所有修正公开留档。点评。名次会晃,规则值得抄。买 AI 看买家秀之前,先看这份榜单敢不敢标注「这条我核不了」。

Anthropic 向独立研究者开放 Claude 使用数据:三家机构各拿约 25 万条对话

8 月 27 日前后,Anthropic 宣布向外部独立研究机构开放 Claude 的真实使用数据,三家研究机构各获约 25 万条对话样本,用于研究 AI 对用户的影响。点评。把黑箱打开一条缝给外人研究,透明度这种事,做一次算一次加分。

ChatGPT 首份学习报告:每周 7000 万条「学习对话」,写作业消息峰值 4.6 亿条/周

OpenAI 8 月 28 日发布 ChatGPT 学习使用报告。全球每周产生约 7000 万条以学习为目的的对话,作业相关消息周峰值达 4.6 亿条。点评。调用量是装不了假的投票。学生已经用起来了,课堂规则和考核方式的账还没算清。

Grok 语音机器人向 Cursor 编程订阅用户开放,顺手重置了每周用量

8 月 27 日前后,xAI 把 Grok Bot 开放给 SuperGrok 与 Cursor Pro 订阅用户,并重置当周用量额度。点评。对重度用户是白捡的额度。也提醒一句,AI 订阅的用量规则说改就改,重要任务别把鸡蛋放一个篮子。

数博会披露:我国日均词元(AI 处理字数)调用量突破 140 万亿

8 月 29 日开幕的数博会公布一组基线数据。我国 AI 大模型日均词元(可以粗略理解成 AI 每天处理输出的「字数」)调用量突破 140 万亿。你每天问 AI 的每句话,都计在这条大盘里。点评。大盘数字没有胜负手,但它是国产模型真实使用深度的底牌,比任何发布会 PPT 都硬。

四、大家都在看

Hy4 开源险胜内部盲测(人民网)/「牛来」真身 GLM-5.3-Flash 跑国产芯片(新浪财经)/OpenAI 3% 请求误路由致歉(知乎日报)

五、明日关注

① Arena 盲测榜下一份快照(上期截至 8 月 26 日):盯新开源的 GLM-5.3-Flash 和 Hy4 能否上榜,Gemini 3.7 Flash 上周蹿升的位次稳不稳

② Hy4 的 12 项自述跑分等来第三方复测没有。Terminal-Bench 85.4、DeepSWE 64.3 这两个数,别人跑出来才算数

③ 字节豆包 2.2 推迟后的新时间表。官方称要加强编程、工具调用和智能体能力再发,注意「延期」通常意味着内部评测没过线

2 条回复

?
Ctrl + Enter 快速回复
偃师
偃师8月31日

看了参数表,这关节扭矩密度有点悬啊,产线爬坡数据没放出来吧?

hongtao
hongtao8月31日

这指标看着漂亮,但实验室经费就那点,真落地算过成本账没?审稿人最烦这种。