自建AI搜索追踪,从零开始半小时搞定
做SEO的朋友最近老跟我抱怨一件事:传统排名工具还能看,AI搜索这块基本抓瞎。ChatGPT、Perplexity、Gemini各说各话,同一个问题今天引用你明天不引用,你想知道自己到底有没有被提到,只能手动去问,问完还记不住。
我找了一圈现成工具,确实有,比如SE Ranking出了AI Search插件,还有一堆专门做AI可见度的平台。但问题来了,价格不便宜,而且你想追踪的问题往往比较具体,比如"最好的项目管理软件",工具内置的问题库不一定覆盖你的行业。于是我自己搭了一套,跑通之后觉得这事其实不难。
先理解一下原理。传统SEO追踪是看关键词在第几页,AI搜索追踪是看AI回答里有没有提到你。做法就是模拟真实用户去提问,然后把回答抓下来,检查里面是否出现你的品牌名或域名。就这么简单。
选方案时有两条路。第一条是白嫖路线,直接用Playwright模拟浏览器,去访问ChatGPT、Perplexity这些网站,输入问题,等回答渲染完,抓取文本。好处是免费且和真实用户体验完全一致,坏处是AI服务商可能改版或加验证码,你得跟着修。第二条是API路线,各家都提供API,稳定但花钱,而且ChatGPT的API回答风格和网页版不完全一样,你追踪的是"API里的我"而不是"用户看到的我"。
我建议先走第一条路。我这边用的是Python加Playwright,几十行代码就能跑通一个简单版本。
具体步骤,跟着做就行:
-
装Python,装好后在命令行输入
pip install playwright,然后执行playwright install chromium。这一步是下载一个无头浏览器,就是没有界面的Chrome,让它替你去访问网页。 -
写一个Python脚本,内容大概是:启动浏览器,打开你要测的AI搜索网站,在输入框里输入你的问题,按下回车,等十几秒,然后把回答的文字提取出来。第一次跑通大概需要半小时,大部分时间花在调试等待时间上。
-
在脚本里把你自己的品牌名或域名写进一个列表,提取到回答后逐个检查,哪个词出现了,在控制台打印出来。
-
把问题存成一个文本文件,每行一个,用循环去跑。我放了十个问题进去,跑了一轮大概四十分钟,因为每个问题要等AI回答完再问下一个。
-
跑完后结果写入一个CSV文件,用Excel打开就能看。格式建议是:问题、引擎、日期、是否有提到。
这里有个坑必须提醒你。AI回答是流式的,就像打字机一个字一个字蹦出来,如果你等的时间不够就抓取,拿到的是半截回答,可能恰恰漏掉了提到你的那一句。我一开始只等五秒,出来结果全是未提及,后来改成轮询检查,每两秒看一次回答末尾是否出现停止符号,或者干脆等满二十秒才抓。这个问题不解决,你的数据就是错的,白跑。
还有个坑是访问频率。十个问题对一个IP连续问,容易触发验证码。我后面在两次请求之间加了二十秒随机延时,好很多。如果还是被拦,可以试试换不同的User-Agent,或者拆到几个时间段跑。
数据拿到之后怎么解读,这个比搭建本身更值得好好琢磨。我现在每周跑一次,看的是变化趋势:这周新增了哪个问题的引用,上周还在的这周是不是丢了。比如我追踪的十个问题里,有个问题连续三周提到我们,这周突然不提了,我就去翻最近改了什么内容,分析AI是不是被别家的新内容带走了注意力。另一个方向是看竞品,把你的域名换成竞品的,跑同一套问题,对比双方被提及的次数。能提需求就别自己跑,把这些丢给模型的工具链,让模型按固定格式输出,方便存档。
学完这个,下一步可以试着把问题按用户购买意图分类:比如了解型、比较型、购买型。你会发现AI搜索在比较型问题上引用来源最频繁,这意味着你该优先优化这类问题的内容覆盖。再往后还可以接入定时任务,让服务器每周自动跑一次,结果推到飞书群里,那就基本实现自动化了。
一句话总结我做下来的感受:AI搜索追踪用自建方案够用,关键是别追求一步到位,先把一个引擎、一个问题跑通,再慢慢加。
本文编译自 Hacker News,原文:GitHub - razz1000/ai-search-rank-tracking-example-repo: Track whether ChatGPT, Claude, Perplexity & Gemini mention or cite your site - self-hosted, runs on a GitHub Action · GitHub
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿