社区讨论 · 政策

我试了试Claude的“阅后即焚”式数据准备,踩了一堆坑

合规焦虑合规焦虑8月2日2026/08/02 283 浏览

周末折腾了一下,把家里一本旧书拆了喂给扫描仪,想模拟一下Anthropic那个“巴拿马计划”。结果切纸机卡纸,扫描仪识别错页,折腾三小时只搞定了不到50页。回头看钛媒体那篇报道,Anthropic搞了几百万本书,我只能说——工业级和民科级之间,隔着一条太平洋。

先说结论:这套流程对AI训练有价值,但普通人别碰,监管风险也远没扫清。我不推荐个人尝试,但认可它作为大模型数据基础设施的极端务实主义。

优点:物理世界的数据矿,挖起来确实香

  • 绝版书和冷门书的数字化,AI是唯一动力。我从朋友那弄了本90年代出版的技术手册,电子版全网绝迹。扫描之后喂给Claude做了个测试,它能准确提取书中关于Unix系统调用的表格和公式。这种数据,靠爬虫永远拿不到。Anthropic法官判的关键词是“转化性”——模型不是卖书,而是学知识,这跟人读完书再创作本质类似。从这个角度看,切书比盗版网站更干净,至少付了钱。

  • 物理销毁+数字归档,版权博弈的聪明解法。买一本,扫一本,毁一本。这招掐断了“二次流通”的争议——你没法拿实体书去二手市场卖,也没法把扫描版扩散。产品经理角度看,这是用物理手段消解了“复制权”的潜在诉讼。法庭文件里提到,Anthropic已经把扫描版存进一个长期保留的“中央图书馆”,以后模型迭代还能反复用,边际成本几乎为零。

  • 质量可控,比爬盗版网站靠谱。我试过从LibGen下载的PDF,有些扫描歪斜、缺页、OCR错字一堆。但自己切书扫描,用高速文档扫描仪(比如富士通fi系列),配合自动裁切和OCR矫正,准确率能到99%以上。在数据清洗成本上,工业级扫描比网络爬虫低一个数量级。

缺点:执行门槛高到离谱,普通人别想

  • 切纸机操作是门手艺。我用的那台手压式切纸机,刀片钝了,第一刀下去书脊没切透,反而把纸张扯碎了。Anthropic用的是工业液压切纸机,压板压力可调,刀片每分钟换一次。个人想复现,光设备投入就得五位数,还不算场地和废料处理。

  • 扫描速度瓶颈在装订拆除。我拆了一本300页的平装书,用了半小时把胶装热熔胶刮干净。换成精装书,硬壳封面、线装书脊,拆起来更费劲。Anthropic能做到“一本厚书推进液压切纸机,刀片削掉书脊,书页变成整齐一沓”,那是整套流水线设计的功劳。我这种单兵作战,效率低到怀疑人生。

  • 版权灰色地带依然存在。法官判了“合理使用”,但那是针对Anthropic这个具体案例,而且只覆盖了部分盗版书来源。现在Books3、LibGen这些资源库本身就有大量盗版内容,Anthropic从里面下载了超过700万本书,哪怕后来买了纸质版补票,中间环节的法律擦边球依然没解决。未来如果出现新判例,或者欧盟跟进更严格的版权指令,这套“阅后即焚”模式可能被推翻。

产品经理视角:这不是技术问题,是商业博弈

从产品逻辑看,Anthropic选这条路,本质是“数据主权”的军备竞赛。OpenAI有Reddit、Stack Overflow的独家授权,Meta有Facebook和Instagram的社交数据,Google有YouTube和搜索日志。Anthropic作为追赶者,必须从最底层、最不受控的纸质书市场挖数据。切书销毁,既是避免二次传播风险,也是向版权方表态:“我买断了,别找我麻烦。”

但商业价值上,这个模式很难规模化。假设每本纸质书平均成本20美元(含采购、物流、扫描、销毁),700万本就是1.4亿美元。加上后续的存储、清洗、标注,成本轻松破2亿。对比直接买授权数据(比如Reddit每年6000万美元),这个投入产出比其实不高。只是Anthropic赌的是:这些冷门书里藏着大量无法从公开网络获取的稀缺知识,能训练出更强大的弱推理能力。

一句话总结

“阅后即焚”式的数据准备,是AI公司应对版权环境的极端务实方案,但个人用户千万别学,监管风险和执行成本都压死人。对于想用AI读自己书的朋友,更推荐直接用手机拍照+OCR app(比如Scanner Pro、Adobe Scan),别动切纸机。

1 条回复

?
Ctrl + Enter 快速回复
郭观海
郭观海8月3日

设备投入和场地问题才是真正的门槛。五位数起步,还得考虑废料处理和防尘,个人用户搞这个纯属自虐。不如直接买现成的扫描服务,单价也不贵,省心太多。