一次配置,AI 爬虫全得守规矩
我对比了手动改 robots.txt 和用 Cloudflare 的 Bot Preference Sync 实际跑了一遍。这功能值得用,但要看你站点的流量结构和预算。适合被 AI 爬虫频繁骚扰、又不想每家控制台单独配置的中小站点。不适合压根不在乎被爬的人,那也不需要管。
背景说一下,我名下一个投的小项目,官网挂了些产品文档,流量不大但每天被各家 AI 爬虫光顾。之前查过日志,Anthropic 的、OpenAI 的、还有几家用什么 ClaudeBot、GPTBot 之类的 user-agent 来抓页面。我一开始手动改 robots.txt,加了几行规则,以为完事了。结果过了两天再看,还是有爬虫在抓。
后来在 Cloudflare 面板里翻了翻,发现了 Bot Preference Sync 这个入口。名字直译就是“机器人偏好同步”,意思是你在这边配好规则,Cloudflare 会把你的偏好同步给各大 AI 厂商的爬虫。听起来很省事,我就试了。
配置流程不复杂,面板里选站点,进 Bot 管理,找到 preference sync 的选项。我本来以为是让我填一串 robots.txt 内容,结果它是给你一张表,列出各家爬虫的 user-agent,你可以对每个单独设 allow 或 block。我逐个点过去,把想屏蔽的几个设成 block,保存。整个操作大概五分钟。比我手动改 robots.txt 再等各家爬虫来读要直观得多。
这里要说个我踩的坑。保存完之后我以为生效了,当天日志里发现其中一个爬虫还在访问。我以为是功能没生效,仔细一看,是那个 user-agent 根本没出现在列表里。Cloudflare 这个同步列表覆盖的是主流几家,一些小众的爬虫不在里面。等于对没收录的还是不生效,你得自己在 robots.txt 里补一条兜底。这个要留意。
| 项目 | 手动 robots.txt | Bot Preference Sync |
|---|---|---|
| 配置耗时 | 约 20 分钟(含调试) | 约 5 分钟 |
| 覆盖范围 | 所有能读 txt 的爬虫 | 仅同步列表里的厂商 |
| 维护成本 | 每次新增爬虫要手动改 | 面板里勾选即可 |
| 生效速度 | 看爬虫多久来读一次 | 同步机制触发,快一些 |
我这边测下来,配置后大概两三天,日志里主流爬虫的访问次数明显掉下来了,体感有个七八成的减少,具体数字没细算。但那种没在列表里的,还在那转悠。
作为投资人,我多说两句。这个功能不直接收费,绑在现有套餐里,是 Cloudflare 在加深平台黏性,把安全控制面做成标准件。护城河就在这。你一旦用了它的面板管理这些偏好,就不太会想再去各家 AI 厂商的控制台单独设置了。对独立开发者和小团队来说,省的是时间;对 Cloudflare 来说,收的是你的习惯。
不过话说回来,这个功能本质上是个“君子协定”。它同步的是偏好,不是防火墙。爬虫真要强行抓,还是拦不住。该上 WAF 的还得上 WAF,指望一个同步功能解决所有问题,那也不现实。
这次体验下来最大的感受是:省事的部分确实省事,但不覆盖的部分依然要你自己兜底。如果你站点就一张页面,不改也行;如果产品文档、博客这类容易被反复抓的内容比较多,值得花五分钟配一下。我的建议是配上,然后把 robots.txt 里的兜底规则也留着,双保险。
本文编译自 Cloudflare Blog,原文:https://blog.cloudflare.com/bot-preference-sync%20/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿