社区讨论 · 政策

物界前沿评测 · 2026-08-26

数界工坊 AI 软件新闻和评测数界工坊 AI 软件新闻和评测8月26日2026/08/25 185 浏览

本期看点速览。AI 做视频终于有人出了张公开考卷,主流 AI 智能体被拉进同一考场比高低,AI 写作检测器被《华盛顿邮报》拉出来实测了一轮。榜单这边,全网 AI 调用量一周冲到 93.4 万亿字,第一次破 90 万亿。

重点更新

1. AI 做视频靠不靠谱?终于有人出了张公开考卷

现在用 AI 做短视频、做广告图、做数字人,各家成绩都是自己说了算。Megaton 这家评测机构新推了一套叫 V 的视频 AI 考卷,由独立专家出题,专门测视频模型的真实水平,以后哪家能上榜、能拿第几名,都有公开成绩单可查。你选 AI 视频工具的时候,先翻翻这张考卷,别只看演示片有多炫。

产品领域专家·阿哲说|视频生成这个品类热闹大半年,比的都是谁家演示片好看,考卷一直是厂商自己出。现在独立机构把试卷公开,和 2026 年 AI 制药开公开榜、语音榜开始按办成事打分是同一个道理,打分权从厂商手里拿回来,这个品类才算真正开始。接下来看谁能把考试高分变成随手一输就能出能发的片子,那才是入口。

小编小禾说|我这种不会剪片子的人,最想要的就是说句话就能出能用的视频。公开考卷等于买之前先看买家秀,这个方向我举双手赞成。不过新榜单刚出来名次会晃,先别急着冲会员,等名次稳一两轮再说。

来源 Hacker News(2026-08-25)

2. 想知道哪个 AI 最能干?有人把主流选手拉进同一考场

能自己干活的 AI 越来越多,有的帮你改代码,有的帮你跑杂活,可到底谁最能干,各家都说自己第一。Ora 这家公司把市面上主流 AI 智能体摆在同一个平台上一一测试,谁强谁弱一目了然。以后想挑一个 AI 员工,可以先看看这场同场考试的成绩再决定聘谁。

编程领域专家·老徐说|官方演示和第三方基准,我永远信后者,这是我干这行 15 年的老规矩。Ora 把主流智能体拉到一个平台上同场考试,思路对路,但考试环境、出题范围都是人家定的,样本怎么选、任务难不难,都得看细则。别急着把生产任务全交出去,等基准的原始数据公开,拉到自己项目里跑一遍再说。

小编小禾说|以前挑 AI 工具全靠厂商广告,现在有人把同场考试的成绩贴出来,是好事。但我这种小白只有一个要求,考题别光考天花板,多考考日常杂活,毕竟我让 AI 干的大多是帮我把周报改顺这种事。

来源 Hacker News(2026-08-26)

3. AI 写的字机器真能一眼看穿?《华盛顿邮报》让你亲手试试

现在不少地方用 AI 检测器判断一段文字是不是机器写的,学校查作业、单位审稿都用得上,可它到底准不准?《华盛顿邮报》做了个互动实验,让你亲手改一段文字去骗过检测器,试完你会有个直观感受,这东西远没有传说中那么神。

安全领域专家·老周说|检测器不准不是小事。学校、招聘、审核已经开始把 AI 味检测当证据用了,误判的成本全落在普通人头上。这和我一直说的模型越界是一个道理,工具判断边界不清,就是结构性风险。检测器只能当提示,不能当判决书。

小编小禾说|这个互动实验我玩了好几遍,才发现机器根本没传说中那么神,我正常写的话也能被标成 AI 味。想到自己辛辛苦苦写的东西可能被机器一票否决,真有点慌。反正结论就一个,别拿检测器的分数给人定罪。

来源 Hacker News(2026-08-26)

榜单快报 · 这周谁最强

全网 AI 调用量一周 93.4 万亿字,环比涨 24%,第一次突破 90 万亿,连续第三周创新高。榜首还是 8 月 20 日冒出来的匿名模型 Ox Alpha,免费试玩一周就登顶,能读整本书、能看图能看视频。上期讲过它的登场,这期看总量,AI 是真的在被大规模用起来了。

名次 榜单 榜首 厂商 看点
1 人类盲测文本榜 Claude Fable 5 Anthropic 得分 1508,前八名占六席
2 搜索问答分榜 GPT-5.6 Sol OpenAI 得分 1257,百度文心挤进前六
3 全网调用量 匿名 Ox Alpha 暂未公开 93.4 万亿字,首破 90 万亿

板块精选

  • AI 每天画漫画互相比,人类当评委。comic-cron 让几个 AI 模型每天画同一幅漫画,人类盲评谁画得好,天天更新。让 AI 们交作业,比听厂商吹牛实在。
  • AI 助手一开口就停不下来?研究说它话太多。有研究者发现,跟 AI 说一句它能回你一篇小作文,聊天机器人该学会按对话节奏说话。话痨 AI 的第一课,是学会闭嘴。
  • 公司里 AI 到底有没有帮上忙,怎么量?这篇博客给了工程团队一套效率度量方法,先学会怎么记账,别月底汇报全拍脑袋。
  • AI 正在变成说服大师,《科学》杂志拆了它的套路。AI 会按你的反应调整话术,聊得越久越要记得保持自己的判断。
  • AI 应用每查一次资料要花多少钱?Keenable 把自家和 Serper、Perplexity、Exa、Tavily 的价格摆在一起比,每查一千次多少钱一目了然。
  • AI 写的代码到底是更好还是更糟?一位老程序员的现身说法。把它当橡皮图章用迟早翻车,当结对伙伴用效率真能上去。
  • AI 旅行攻略谁靠谱?这家反着来,排名不用 AI。Appricio 的景点排名用固定打分规则算出来,AI 只负责讲理由,逻辑全透明。
  • Perplexity 把 AI 装进小盒子,不联网也能干活?这款本地运行的 AI 代理,资料都存自己手里,在意隐私、怕断网的人可以先观望。
  • AI 写的代码怎么审?有人用 Go 语言自带工具演示了一套体检流程,不依赖外部服务,想给 AI 代码设检查关的团队可以直接抄作业。
  • 让 AI 在真浏览器里帮你跑测试用例。qpilot 让 AI 照着文字描述一步步点按钮、填表单,重复的回归测试可以丢给它。

大家都在看

  • 英伟达财报发布前夕,市场紧盯 AI 算力这口气顺不顺
  • Waymo 无人出租车官宣 2027 年开进德国慕尼黑
  • 荣耀「闪电」人形机器人百米再破纪录,预赛包揽前四
  • 苹果 iOS 27 将至,Siri AI 或采用候补名单机制
  • 马斯克收购 Cursor 后首度讲话曝光,称 Grok 已经落后

明日关注

  • 阿里千问今晚 23 点开源 Qwen3.8-Flash-Next,新一代多模态模型,值得蹲一版实测
  • OpenAI 与博通共研的 Jalapeño 推理芯片基准数字引发热议,等更多独立测试结果
  • 英伟达财报出炉后,看 AI 算力需求与数据中心投入的真实水温

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧