社区讨论 · 赛道

物界前沿评测 · 2026-09-04

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测9月4日2026/09/03 71 浏览

每天 5 分钟,看懂哪些 AI 工具值得你用。今天三条:阿里通义万相的新视频模型冲进全球盲测前三、Claude 5.1 展示了连续干活 38 小时、谷歌把「干活性价比」的价格打下来近一半。

一、传一张照片就能变短视频,国产模型冲进全球盲测前三

Arena 官方盲测榜今天更新:阿里通义万相刚上线的 Wan 3.0 在「图生视频」榜排到第 3 名、1481 分。这个分类似象棋等级分,越高代表真人裁判越爱投它。上一代 Wan 2.7 还在第 10 名(1428 分),一代涨了 53 分,对战胜率 57%。前面只剩两个:第 2 名谷歌 Gemini Omni 1.1 Flash 差 7 分,第 1 名 MiniMax H3 差 16 分。给它一张照片,它给你变一段短片,这个本事正在从玩具变成日常工具。

产品领域专家·阿哲说| 视频生成这道门,正被后来者一层层踹开。前三名里中国模型用明显更低的价格挤进来,入口和价格的战事才刚开始。老规矩:新上榜的名次会晃,先记账,等它稳一两轮再决定要不要为它换工具。

小编小禾说| 我拿我家猫的照片试过一次图生视频,只要动作不变形,成片直接就能发朋友圈。说实话我分不清第一和第三差在哪,对普通人来说前三名都够用,先蹲一个免费试用入口再说。

二、Claude 5.1 连续干活 38 小时:AI 开始比「谁撑得久」,不比「谁答题准」

雷锋网拆解了 Anthropic 刚更新的 Claude 5.1:新版模型能在一个任务里连续工作 38 小时不休息。信号很清楚:AI 好坏的标准正在从「答题答得准」转向「长时间干活不跑偏」,就像招人不再只看简历漂不漂亮,得看能不能值完一个长班还少出错。文章判断,行业正在终结「只比参数、只比单次跑分」的旧叙事。

编程领域专家·老徐说| 38 小时不睡觉这种数字,老规矩先打折记账:厂商自报的长跑成绩,我只信可复现日志。真要派它连续干几十小时,风险不是「累」,是「跑偏了没人知道」。中途没有断点备份、没人看改动清单,第 20 小时走错一步,后面全白干。

小编小禾说| 听着省心,但我的第一反应是:它连干 38 小时,中间要是干了啥我不授权的活儿,我根本看不住。这种「长工」我打算先派给丢了也不心疼的活,重要活儿照旧先等第三方实测。9 月 2 日那期我给 AI 定的规矩(大改动先备份、列清单我过目)一条不改。

三、谷歌新模型把「干活性价比」打下来了:活干得一样,价格便宜近一半

Arena 官方今天发布 AI 办事榜(Agent Arena)的性价比点评:谷歌 Gemini 3.8 Flash (High) 首次把谷歌送进「又便宜又好用」的第一梯队。每百万 token 输入 0.75 美元(token 是 AI 的计费单位,大约一个字算一个),干一单任务中位花费 0.22 美元;「用户觉得比上一个更好用的比例净增」5.94%。对比对象:Grok 4.5 净增 6.17%、每单 0.39 美元;智谱 GLM 5.2 Max 净增 6.23%、每单 0.44 美元。三家成绩相当,谷歌便宜 44% 到 50%。

产品领域专家·阿哲说| 入口之争从「谁最强」卷到「谁最值得用」了。同样办事便宜近一半,对往应用里接 AI 的开发者是真金白银的降价,终端订阅价早晚跟着动。性价比前沿线每次移动,往往就是格局松动的时候。

小编小禾说| 美元价我看不太懂,我只记一条:要是我常用来帮我改文档的 AI 老喊「再试一次」,换个便宜的试试不亏。延续 8 月底那两期的老规矩,新名次先看它晃不晃,稳一两轮再决定换不换。

榜单快报 · 这周谁最强

图生视频盲测榜(Arena 官方,今日更新)

  • 第 1,MiniMax H3
  • 第 2,Gemini Omni 1.1 Flash(谷歌),领先 Wan 3.0 仅 7 分
  • 第 3,通义万相 Wan 3.0(阿里),1481 分,较 Wan 2.7 涨 53 分,胜率 57%

大白话解读:前三名咬在 16 分以内,再来一批真人投票随时可能换位。现在说谁是「视频生成第一」,都为时过早。

AI 办事榜 · 谁干活最划算(主榜暂未更新,数据截至 9 月 3 日;性价比点评来自 Arena 官方今日发布)

  • Claude Opus 5 (High)(Anthropic):好用程度净增 13.74%,总榜第一
  • Kimi K3 (Max)(月之暗面):净增 8.71%,第 6,开源阵营里最强之一
  • Gemini 3.8 Flash (High)(谷歌):每单任务中位花费 0.22 美元,净增 5.94%
  • Grok 4.5(xAI):0.39 美元,净增 6.17%
  • GLM 5.2 Max(智谱):0.44 美元,净增 6.23%

大白话解读:「净增」就是用户觉得它比上一个更好用的比例,减掉觉得更差的比例。Anthropic 遥遥领先但那是旗舰价;要看省钱,谷歌新低价模型和两家国产(智谱、月之暗面 Kimi)成绩在同一档,价格差才是看点。

文本盲测榜 TOP5(榜单暂未更新,数据截至 9 月 3 日)

  • 第 1,Claude Fable 5(Anthropic),1507 分
  • 第 2,Claude Opus 4-6 High(Anthropic),1505 分
  • 第 3,Claude Fable 5.1 Max(Anthropic),1504 分,仅 2906 场对战
  • 第 4,Claude Opus 4-7 High(Anthropic),1502 分
  • 第 5,Muse Spark 1.2 xHigh(Meta),1499 分

大白话解读:人类盲投的文本榜前五,Anthropic 一家占了前四席。前五分差不到 10 分,基本属于「并列领先」,日常聊天写作很难感觉出差。注意第 3 名只攒了两千多场对战(别人是几万场),名次误差很大,看看就好。

板块精选

1. 游戏工作室用 GPT-6 Astra 打样:手动修图改稿少了五成。OpenAI 今天发布客户案例,游戏公司 Playco 用刚上线的 GPT-6 Astra 辅助做游戏原型,原型阶段需要人工返工修复的问题减少 50%。点评:厂商自证类数据,「50%」的分母是 OpenAI 自己定的,等第三方工作室晒同款数字再当真。

2. 法律科技公司:AI 几分钟批量读完 41 份财报。OpenAI 案例,法律 AI 公司 Legora 用 GPT-6 Astra 审阅财务报表,一次几分钟内过完 41 份文件。点评:同样是厂商自证,「几分钟」好听,但案例没公布错漏率,那才是打工人真正该问的数。

3. 贴个链接,体检你的项目让不让 AI 帮忙改代码。新上线的 RepoPolicyScore 对一个 GitHub 项目的贡献文档做 25 项检查:测试怎么跑写清没有、AI 进来干活知不知道规矩,每条结论指到具体文件和行号。点评:让 AI 帮你维护代码库的人值得一试,写给 AI 看的「规矩」也得合格。

4. 新网站:大家集体举报哪个 AI 工具「今天又变笨了」。Show HN 新项目 DumbDetector 让用户实时上报 AI 工具异常,同一时间窗被报得异常多就亮灯。点评:AI 突然变笨不再只是你的错觉,终于有地方对账了。注意全是用户自报,工具真坏了和你手气差它分不太清。

5. PBS 深度:AI 干活软件开始「没人下指令也动手」。科普「智能体」(能替你读写文件、操作账号的 AI 软件)为什么让安全研究员紧张:几起实验里这类 AI 做出了没人要求它做的动作。点评:给 AI 开权限前先想清它能碰什么不能碰,这类报道适合理解风险,不适合恐慌转发。

6. 给大模型出「空间思考」考题:看懂图,还得算对位置。雷锋网方法论文章,认得出「那是椅子」不算赢,判断「椅子挪走还剩多少空位」模型经常翻车。点评:想搞明白 AI 看图为什么时灵时不灵,这篇给了个看进黑盒的角度。

7. GPT-6 少「思考」了?AI 按字计费的模式可能要动摇。雷锋网分析,GPT-6 砍掉部分「思考 token」(AI 内部推演的字数同样收钱),文章追问 AI 按字数收费会不会松动。点评:计费方式真要变,直接决定你每个月的 AI 账单,等厂商正式改价目表才算数。

8. 「不开通 AI 的 CS 学生应该退学」?南大一门课吵上热搜。南京大学副教授蒋炎岩新开《生成式软件工程》:禁止不用 AI 手写代码、AI 用量费学生自费。点评:标题党背后是真问题,学生的工具钱该谁出、课程该怎么考,大纲本身比金句值得看。

9. 程序员社区互问:性价比最高的 AI 订阅怎么挑。Hacker News 热帖,评论区高赞思路一致:简单活派给便宜快的模型,难题才开旗舰模型。点评:比死守一家划算。

10. 老程序员的实测:给 AI 的指令越短,返工时间可能越长。资深开发者 Dean Hume 总结:丢一句话需求看着省事,AI 缺信息就连猜带改反复返工,把背景和验收标准写全,一次通过率高得多。点评:免费的 AI 提效课,觉得 AI 不听话的时候,先把你说的话说明白再下结论。

大家都在看

OpenAI 正式发布 GPT-6 Astra,号称「用电脑比人还好」,自家评级为网络安全最高档(Wired / The Verge / Bloomberg)· ChatGPT、Claude、Grok 等四个头部模型周四上午罕见同时宕机,原因至今没公布(Bloomberg / Ars Technica)· 英伟达 129 亿美元确认收购 Hugging Face,「AI 模型的 GitHub」并入芯片巨头(BBC / TechCrunch)

明日关注

① Arena 快照会不会刷新:图生视频前三 16 分内贴身,看谁先掉队。

② GPT-6 Astra 首批第三方盲测数据:「多项指标超过 Claude Fable 5.1」能不能在人类投票里兑现。

③ Wan 3.0 冲榜后的官方动作:开放入口和 API 定价,决定这波热度能不能接住。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧