用 Python 查你的藏书有没有被 AI 公司盯上,三行代码搞定
被朋友安利了用 Python 批量查 ISBN 的方法,说是能知道自己书架上的书有没有被列入 AI 采购清单。我本来觉得这事挺玄乎——上周刚看到新闻,AI 公司通过 ISBNdb 下单,一次买几千本甚至上百万本,扫描完直接粉碎销毁。我那几本泛黄的旧书,搞不好已经变成了 Claude 的训练数据。
直接搜了一下,ISBNdb 已经把 AI 采购页面撤了,但公开的图书查询接口还能用。我花半小时写了个脚本,跑了一遍自己书架上的 50 本书,结果 18 本被标记为“2022 年以前出版”,其中 3 本还是绝版教材。讲真,心里有点复杂。
这篇教程手把手教你从零开始,把自己的藏书过一遍筛子。不需要懂编程,跟着步骤走,大概 15 分钟搞定。
第一步:准备你的 ISBN 列表
ISBN 就是书脊或封底那串 13 位数字(也有老的 10 位)。每本书都有,像身份证号。你需要把想查的书都列出来,一行一个 ISBN。
操作流程:
1. 打开手机备忘录或电脑上的记事本。
2. 翻出每本书,找到 ISBN(通常在条形码上方)。如果找不到,可以用手机上的“扫一扫”功能识别条形码,系统会显示数字。
3. 把这些数字逐行输入,保存为 `books.txt` 文件。格式如下:
```
9787544291163
9787532768457
9787208061644
```
注意:不要加横线或空格,纯数字即可。如果书是 10 位的老 ISBN,后面加 `978` 和校验位变成 13 位,但大部分老书也能直接查到。
踩坑提醒:我一开始把书名和作者写进去了,但 ISBNdb 只认 ISBN 数字。所以只保留数字,一行一个。如果你有 100 本书,手动输入会累死人。建议用手机 OCR 软件拍书脊,自动提取 ISBN,亲测 准确率 90% 以上。
第二步:安装 Python 和必备工具
Python 是免费编程语言,有手就行。Windows 用户去官网下载安装包,macOS 用户打开终端输入 `brew install python3`(没有 Homebrew 的话先装)。Linux 用户自带 python3,跳过。
打开终端(Windows 是 cmd 或 PowerShell),依次输入以下命令按回车:
```
pip install requests
```
等它跑完就行。如果提示 `pip` 找不到,试试 `python3 -m pip install requests`。
新手常见错误:安装时输错单词,比如 `instal` 少了个 l。我当初就卡在这五分钟。复制粘贴最稳。
第三步:写脚本,跑查询
新建一个文件,命名为 `check_books.py`,用记事本打开,复制粘贴以下代码:
for isbn in isbns:
url = f"https://openlibrary.org/api/books?bibkeys=ISBN:{isbn}&format=json&jscmd=data"
r = requests.get(url)
data = r.json
if f"ISBN:{isbn}" in data:
book = data[f"ISBN:{isbn}"]
title = book.get("title", "未知书名")
pub_date = book.get("publish_date", "未知年份")
subjects = book.get("subjects", [])
subject_str = ", ".join([s["name"] for s in subjects[:3]])
print(f"ISBN:{isbn} | {title} | {pub_date} | 主题: {subject_str}")
else:
print(f"ISBN:{isbn} | 未查到")
time.sleep(1) # 避免请求过快被封
```
注意:这个脚本用的是 OpenLibrary 的公开 API,和 ISBNdb 不同,但数据更全,而且免费不限量。ISBNdb 的 API 需要付费,不推荐新手。
保存后,在终端里进入脚本所在目录(比如 `cd ~/Desktop`),然后输入:
```
python3 check_books.py
```
如果一切正常,你会看到一行一行输出,格式像这样:
```
ISBN:9787544291163 | 百年孤独 | 2011 | 主题: 文学, 魔幻现实主义
ISBN:9787532768457 | 深入理解计算机系统 | 2016 | 主题: 计算机科学
```
预期结果:每个 ISBN 对应一行,显示书名、出版年份和主题。如果查不到,多半是 ISBN 写错了,重新检查。
第四步:筛选出“高危书籍”
AI 公司采购清单里的核心特征是:2022 年以前出版、主题冷门(尤其是专业教材、绝版书)。把脚本输出结果复制到 Excel 或表格里,手动过滤。
我做了个简单表格,对比了自己的 50 本书:
| 类别 | 数量 | 说明 |
|---|---|---|
| 2022年及以后出版 | 32 | 相对安全,AI 公司不太要 |
| 2022年以前出版,非冷门 | 15 | 可能被关注,但风险较低 |
| 2022年以前出版,冷门/绝版 | 3 | 高危,建议拍照留存 |
踩坑:我一开始只看出版年份,忽略主题。后来发现一本 2005 年的《线性代数习题集》居然在 OpenLibrary 上标记为“稀有藏本”,立马长了个心眼。如果你的书在二手市场上能卖到原价 2 倍以上,大概率是目标。
第五步:实际保护措施
查到高危书之后,你可以做三件事:
1. 拍照扫描:用手机或扫描仪留存 PDF,至少内容不会消失。
2. 标记所有权:在书内页写“此版本禁止用于 AI 训练”,虽然法律效力存疑,但能表明态度。
3. 捐赠图书馆:一些大学图书馆会接收稀本书,比卖给二手商更安全。
加粗注意:千万别在闲鱼上低价甩卖你手中冷门旧书,很可能被 AI 公司的中间商扫货。我有个朋友 3 块钱卖了一本《化工原理》第三版,结果 ISBNdb 上同款二手价涨到 80 块,原因就是 AI 公司大量采购。
学到这一步,下一步可以试什么
你还可以把脚本升级一下,自动对比出版年份,输出高危列表到 CSV 文件,方便分享给朋友。或者用 ISBNdb 的公开搜索(直接访问网站,手动输入 ISBN)看有没有“批量采购记录”,虽然页面撤了,但部分历史数据可能还在。
留一个问题:你觉得 AI 公司粉碎旧书和谷歌扫描图书馆,本质区别在哪里?欢迎在评论区聊聊。
物界前沿