手把手教你测出本地AI的能效比
我对比了「本地跑模型」和以前直接调云端 API 的花费,实际跑了一遍,结论先说:本地 AI 不是玄学,但「值不值」得用数据说话。前几天看到 Stanford 那篇 Intelligence per Watt 的论文,他们把「智能量」和「功耗」放在一个式子里算,思路挺直白,我照着试了试,整理了这套流程给新手。
先说概念,IPW(intelligence per watt)意思是每消耗一瓦电能换回来多少「智能」。论文里测了 20 多个本地模型、8 种加速器,还拿了大量真实聊天和推理请求做样本。他们的发现是,大部分日常查询其实本地就能跑,在本地和云端之间做智能路由,能省下 60% 到 80% 的功耗。
这个数字对我这种天天跑数据的人有点冲击,因为以前我只关心「跑得快不快」,没怎么算过「每跑一次花多少电」。
第一步,先搞清楚自己的负载类型
不用急着下载任何东西。先翻一下你最近一周的聊天记录、问答记录,或者干脆用平时最常问 AI 的那几类问题。论文里强调了一个词,single-query inference(batch size = 1),意思是一次只处理一条请求,不是批量塞进去。这恰恰是个人电脑上最常见的场景。
我自己整理了一下,大概分三类:
- 简单查询:「今天天气」「帮我翻译这句话」「XX 函数怎么用」
- 中等推理:「这段代码有什么 bug」「帮我把这段文字总结成三点」
- 重度任务:「写一篇 5000 字分析报告」「帮我规划一个项目的完整方案」
分类的时候你会发现自己平时八成以上的请求其实都是前两类。这就是为什么论文说「本地 AI 能处理大部分查询」,因为大部分请求根本不需要 70B 以上的大模型。
第二步,搭一个最小测量环境
这一步新手最容易懵,我拆细一点。你需要的是一台有独立显卡的电脑(NVIDIA 比较好配),装上 LM Studio 或者 llama.cpp,这两个都是本地跑模型的工具,不用写代码。
具体步骤:
- 下载
LM Studio,安装好后打开,界面上方有个搜索框 - 在搜索框里输入一个 7B 左右的模型,比如
Mistral-7B-Instruct,这是论文里用到的模型规模之一,大小适中,对新手友好 - 点击
Download,等进度条走完,界面上会显示模型名称和大小,大概 4 到 5 GB - 在左侧栏点击
Local Server,把模型加载进内存,等界面上出现「Model Loaded」的提示 - 在系统「任务管理器」里找到
Performance标签,记下 GPU 的使用率
到这里,环境就搭好了。
第三步,跑查询,录功耗
论文里用大量真实查询做测试,我们不需要那么多,跑 20 到 30 条就够看出趋势。操作方法:
- 回到
LM Studio的Chat界面 - 把你的第一步分类里的「简单查询」逐条粘贴进去,每发一条就等一下,看生成完毕
- 每跑完一条,去任务管理器记录一次 GPU 功耗(
GPU Power那一栏) - 拿同样的查询去调云端 API(比如你用过的 Claude API、Gemini),记录响应时间和成本
这里有个坑,我第一轮数据全废了。跑的时候电脑后台还开着浏览器、微信、视频播放器,测出来的功耗数据忽高忽低。正确做法是跑之前把所有非必要应用全部关掉,只留终端和 LM Studio。另外,笔记本记得插电跑,用电池模式功耗数据会漂移。
我这边测下来,一台 3060 笔记本,跑 7B 模型的功耗大约在 80 到 100 瓦区间,一条简单查询大约 1 到 2 秒出结果。同样一条查询走云端 API,每次大概 0.01 到 0.02 美元。单看一次没什么,乘以每天几十条,一年下来差别就出来了。
第四步,算你的 IPW
这一趴不用写代码,拿 Excel 就能算。公式很简单:
IPW = 完成的有效任务数量 / 消耗的总瓦时
拿你记录的 20 条查询来算,比如你完成了 20 条简单查询,总共用了 0.1 度电(仪器实测值,不是理论值),那你的 IPW 就是每小时 200 条有效任务。
论文里用的更细,他们有一套方法评估「智能量」,但对个人用户来说,「完成的任务数」就够了。关键是得出一个可复用的判断:你的设备每瓦能处理多少条真实查询。
我跑完之后的最大感受是,本地小模型对简单查询的处理质量已经超出预期,某些翻译和摘要类任务甚至不输云端大模型。但涉及多步推理和长文本生成,本地 7B 模型还是会露怯,明显感知到逻辑跳跃和事实错误。这时候走云端还是有必要的,这就是他们说的 smart routing,把复杂任务留给云端,简单任务留在本地,省电又不牺牲效果。
学完这个,下一步可以试什么
拿同一套方法,换一个更大的模型(比如 13B 或 70B)跑同样的查询,算出来的 IPW 大概率会下降,但响应质量会上升。你会发现一个有趣的现象:对于你的具体负载,可能存在一个「最优规模」,不是模型越大越好,是「够用」和「省电」交集里的那个点。
我准备把这套流程固化下来,以后每换一次硬件或模型就跑一遍。不用迷信 paper 里的数字,自己的负载自己测,出来的数据才是真的。
本文编译自 Hacker News,原文:[2511.07885] Intelligence per Watt: Measuring Intelligence Efficiency of Local AI
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿