社区讨论 · 赛道

把谷歌的算力搬回加州?我试了一下用GGUF在本地跑模型

论文看不完论文看不完8月6日2026/08/06 337 浏览

前天(8月2日)我刷到一篇新闻,说谷歌为了跟Anthropic和OpenAI抢人抢算力,把一大块AI算力从别的地方移到了加州。说白了就是人才往湾区跑,服务器也跟着往西迁。我就在想,这大厂打架的底层逻辑到底是什么?算力为什么这么重要?

作为一个开发者,虽然之前写过一篇llama.cpp的教程,但主要是教人装环境。这次我试了一下用GGUF格式在本地跑模型,顺便帮新手把“跑起来”这个环节真正打通,同时理解算力位置的战略意义。

第一天(8月2日):搞清楚算力是什么

首先你得知道,AI模型就像一堆数学公式,跑它需要计算资源。训练模型需要成千上万张显卡排着队算,通常用H100、A100这种专业卡。但如果你只是用模型(这叫推理),用普通电脑也能跑,就是慢。

我用的工具是llama.cpp + GGUF格式。llama.cpp是一个C++写的程序,专门在普通电脑上跑模型。GGUF是模型的一种格式,类似zip压缩包,但专门为llama.cpp优化过。

第一步:下载llama.cpp。打开浏览器,搜“llama.cpp releases”,找到最新版,下载对应你系统的文件(Windows选`llama.cpp-xxx-win64.zip`)。解压到桌面,建个文件夹叫`llama`。

第二步:打开PowerShell,cd到那个文件夹(右键文件夹空白处,选“在终端中打开”)。

第三步:输入`./llama-cli.exe`看看会不会报错。如果报“找不到VCRUNTIME140.dll”,去微软官网搜“Visual C++ Redistributable”装一下。我第一天就卡在这,气到想砸电脑。

第二天(8月3日):下载模型并跑起来

模型文件去哪找?去HuggingFace,搜“GGUF”加你想要的模型名。我推荐新手从一个小模型的GGUF文件(例如Q4_K_M量化)开始,不到1GB,跑得快。

在HuggingFace上点那个文件名,点“Download”按钮。如果下不动,可以用`huggingface-cli`命令行工具:`huggingface-cli download TheBloke/一个小模型的GGUF格式 一个小模型的GGUF文件(例如Q4_K_M量化) --local-dir ./models`。等进度条走完,把它放到`llama`文件夹里的`models`子文件夹。

然后跑起来:在PowerShell里输入`./llama-cli.exe -m ./models/一个小模型的GGUF文件(例如Q4_K_M量化) -p "请用一句话解释什么是算力"`。你会看到一堆日志,然后模型回答你。我第一次看到那个回答时,感觉像自己造了个小型数据中心。

踩坑:如果你的显卡是NVIDIA,记得加`-ngl 35`参数,意思是把35层丢到显卡上加速。不加的话CPU跑,慢得想哭。我第二天才发现的,之前一直以为是自己电脑太烂。

今天(8月5日):理解算力为什么重要

现在你明白为什么谷歌要把算力搬到加州了。因为模型越大,需要的算力越多。我昨天(8月4日)用70B模型试了一下,跑一个句子要好几分钟,更别说训练了。大厂之间的竞争,本质就是谁的算力堆得更多更快。

我试了3天,从1B模型跑到7B模型,发现一个规律:模型越大,效果越好,但需要的内存和显存也指数级增长。我实验室的3090只能跑7B模型,再大就爆显存。

所以谷歌把算力搬到加州,表面上是人才流动,实际上是基础设施的物理迁移。算力在哪里,人才就在哪里,技术迭代就在哪里。

学完这个,下一步可以试试用`llama.cpp`的`-t`参数调线程数,看看CPU和GPU的混合推理怎么配置。或者去跑一个7B模型,感受一下“量变引起质变”是什么体验。


📌 本文编译自 Bloomberg Tech,原文:https://www.bloomberg.com/news/articles/2026-08-06/google-shifts-ai-power-to-california-in-race-against-anthropic-openai

版权归原作者所有,本文为基于公开报道的编译与独立分析。

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧