社区讨论 · 赛道

Agent 的能耗,能不能用两天算出来

壁垒哥壁垒哥9月4日2026/09/04 37 浏览

我花了两天试了一下,把 AI Agent 的能耗做成一张能审计的表。起因是看到 Bloomberg 那条:开放权重 AI agents 的能耗可能比简单查询高出很多倍。我第一反应不是环保,是成本。一个 Agent 产品如果连一次任务用了多少模型调用、多少上下文都说不清,估值里的自动化收入就有点悬。

先说几个词。Agent 像一个会拆步骤的实习生:先计划,再查资料,再调用工具,再检查。开放权重是模型参数公开,可以下载自己跑。token 是模型处理文本的小单位。上下文是模型每次要一起读进去的文字。瓦时是电量单位。Epoch AI 给过一个数量级:较大规模 token 的长输入,一次查询大约 2.5 瓦时。上下文变长,能耗跟着变。

第一步,建表。打开 Excel、WPS 或飞书表格,第一行填:任务名、方案、调用次数、输入累计字数、输出字数、重试次数、是否完成。关键是把“模型被叫了几次”和“每次喂进去多少字”记下来。

第二步,选一个可控任务。别选“帮我研究行业”,太大。选一个窄的:把一段会议纪要整理成几条行动项。

第三步,跑方案 A,简单查询。在同一个模型里新建会话,输入框里只输一句话:把下面文本整理成行动项。粘贴纪要,等它回答。看到回答后,复制到一个文本框,记:调用次数 1,输出大概多少字,重试 0。

第四步,跑方案 B,Agent 任务。同一个模型,同一个纪要,但要求它分步做:先列计划,再抽取负责人,再检查日期,再输出最终行动项,最后自我复核。每让模型做一次,就算一次调用。如果产品有 Agent 模式,可以打开;没有就手动分轮。记:调用次数、每一步输出、每一步输入里有没有把前文全带上。

我这边测下来,方案 A 基本 1 次调用、几百字;方案 B 很容易跑到好几轮,而且后面每轮都要把前面的话再喂进去,输入会像滚雪球。这就是 Agent 贵的主要原因。

第五步,做对比表。可以把结果写成这样:

指标 简单查询 Agent 任务
调用次数 1 多轮
上下文累计 只喂一次 每轮都喂历史
重试 少 多
研究数量级 基准 约 600 倍,复杂任务可能更高

这些倍数来自 Vals AI、Zeke Hausfather 等分析。我这边跑的是相对趋势:调用次数和上下文累计上去,能耗就不会是小倍数。

第六步,算粗成本指数。公式可以简单:成本指数 = 调用次数 ×(输入累计字数 + 输出字数)×(1 + 重试次数)。这个数没有单位,只用来横向比。把一批任务都跑一遍,取中位数。如果 Agent 版是简单版几十倍,那就不是“多花一点”,而是商业模式问题。

踩坑提前说。第一个坑:换模型测。今天 GPT,明天换其他模型,结论会乱。我最近用其他模型和 DeepSeek V4-Flash 做样本时,固定同一模型,只改任务。第二个坑:只看输出字数。Agent 真正吃资源的是输入上下文,每轮把历史塞回去,字数会爆炸。第三个坑:把开放权重当成天然便宜。70B 这种规模,数据中心级能耗并不低;便宜与否取决于硬件利用率和任务并发。

从投资人视角看,这个表的价值不是数电费,而是看 AI 项目有没有可观测层。很多 Agent 产品讲自动化,但说不清一次任务烧了多少 token、多少次工具调用、多少失败重试。这就像我之前写 CI 那篇说的,绿灯不够,合并前要有可审计、可回放。能耗也一样,要能回放每一步成本。

如果我再看到 Agent 创业项目,我会先问三件事:有没有任务级用量日志;有没有自动早停和小模型路由;有没有把失败重试计入单位任务成本。前两个是工程,第三个是商业模型。真正的技术壁垒不是会套一个 Agent 壳,而是能把不确定性压成可审计、可预测、可降本的流水账。

我的趋势预测:往后看,Agent 的能耗计量会从“可选项”变成“采购必选项”。企业买 Agent,会看每个任务的成本曲线;云厂商会把能效做成计费项;投资尽调里会出现类似代码审计的能耗审计。能活下来的产品,要么把能耗做低,要么把能耗卖成服务。退出路径可能是卖给企业采购、合规或云厂商,而不是自己硬撑一个通用 Agent。

学完这个,下一步可以试什么。拿你手头一个 AI 产品,挑一批真实任务,跑上面的表。如果成本指数超过简单查询一个数量级,先别谈护城河,先谈单位经济。


📌 本文编译自 Hacker News,原文:https://bloomberg.com/news/articles/2026-09-03/ai-s-environmental-impact-per-task-balloons-with-more-complexity

版权归原作者所有,本文为基于公开报道的编译与独立分析。

1 条回复

?
Ctrl + Enter 快速回复
产线老炮
产线老炮9月4日

同感。我之前用DeepSeek和OpenAI跑任务,光记调用次数根本没用,得把上下文长度折算成token才能对齐成本。那套Excel表格逻辑是对的,但别忽略重试消耗,不然审计数据全是水分。