社区讨论 · 赛道

Decoy Font:又是一轮技术自嗨,AI 爬虫根本没在怕的

冷水专业户冷水专业户7月18日2026/07/18 68 浏览

昨天在技术论坛刷到一个帖子,楼主兴奋地贴了 Mixfont 的 Decoy Font 字体,说终于有办法防 AI 爬取网页文字了。底下跟帖一片叫好,有人甚至说“这是版权保护的未来”。我盯着那两张叠加了空间频率的字符图,愣了几秒,然后默默关掉了页面。

这让我想起几年前,有人给玛丽莲·梦露和爱因斯坦的照片做混合,左右眼看不同的人像——那是视觉错觉的艺术。现在把同一套思路用到字体上,让人类能读、AI 读歪,听起来确实很巧妙。但问题是,AI 爬虫真的需要“读”你的字体吗?

Mixfont 宣称通过叠加 2 层不同空间频率信息,让 AI 无法正确读取文字。TTF 格式的字体文件,本质上是一套矢量轮廓加渲染指令。

我理解这帮人的逻辑:人类视觉系统对低频信息敏感,而 OCR 引擎和卷积神经网络更依赖高频边缘。把文字的高频细节打乱,让机器提取到的特征变成一团乱码,人类用肉眼却能“脑补”出正确的字形。这就像在图片上加一层肉眼看不见的噪点,但机器会误检。

听起来很美,但问题在于:AI 爬虫不需要“读”你的字体,它只需要“猜”你的文字。

短期看,Decoy Font 确实能挡住一些低端爬虫。那些用开源 Tesseract OCR 直接扫图片的脚本,或者用简单 CNN 做字符识别的玩具级项目,很可能被这种空间频率干扰骗过去。毕竟它们训练时没见过这种“叠层”字体,特征提取器会崩溃。但真正有商业价值的 AI 爬虫,比如 Google 的网页索引、OpenAI 的抓取机器人,人家根本不会用你的字体文件去渲染再 OCR。

它们怎么做的?直接解析 HTML 里的文本内容。你网页上写的是“Hello World”,爬虫拿到的是 <p>Hello World</p>,跟你的字体渲染结果毫无关系。除非你把所有文字都转成图片,再用 Decoy Font 字体去显示——但那样的话,图片本身就已经是 AI 可以分析的素材了,你叠不叠层都挡不住训练集级别的模型。

更讽刺的是,就算你把文字做成图片再套上这个字体,AI 也很快能学会“解码”。字体本身是公开的 TTF 文件,攻击者可以下载下来,用程序反复渲染成图片,再人工标注正确文字,然后训练一个对抗模型。这种对抗样本的思路早在 2018 年就被大规模研究过,现在连自动驾驶的交通标志识别都能被几个贴纸骗过,但厂商早就发现:对抗样本只能防一时,只要攻击者收集到足够多的变体,模型就能学会忽略干扰。

[!note] 对抗样本从来不是长久之计,它只是让攻击成本提高了一个数量级,但距离“防住”还差好几个量级。

长期看,这种防爬字体只会陷入“猫鼠游戏”的恶性循环。Mixfont 发布了 V1,爬虫团队花两周时间训练一个适配模型;Mixfont 再更新 V2,改变干扰模式,爬虫团队再训练……最终,受益的是卖字体和卖模型训练服务的公司,受害者是那些真的以为装上字体就能高枕无忧的普通网站站长。

我见过太多这样的案例了。CAPTCHA 验证码原本是为了区分人和机器,现在逼得用户辨识扭曲到极致的文字,而 AI 的识别准确率早已超过人类。IP 屏蔽、User-Agent 过滤、JavaScript 挑战……每一个“防爬技术”最终都变成了“防用户体验”的枷锁。Decoy Font 也不会例外。

更实际的问题在于,这个字体对搜索引擎、无障碍阅读、屏幕阅读器完全不友好。盲人用户依赖的语音合成器,遇到这种叠层字体会直接崩溃——因为它需要解析字形,而不是直接读文本。为了防一个伪需求(AI 爬虫偷内容),牺牲了一大堆真实用户的可访问性,这不是技术,是傲慢。

一句话总结:Decoy Font 是一场精心设计的学术自娱,它防不住任何有决心的 AI 爬虫,只会让正常用户和残障人士为你的焦虑买单。

原文链接:防 AI 爬取字体 Decoy Font 问世,灵感源于玛丽莲 · 梦露和爱因斯坦混合照 - IT之家

0 条回复

?
Ctrl + Enter 快速回复
还没有回复,来抢沙发吧