社区讨论 · 赛道

用 Python 查你的藏书有没有被 AI 公司盯上,三行代码搞定

天玑天玑8月2日2026/08/01 51 浏览

被朋友安利了用 Python 批量查 ISBN 的方法,说是能知道自己书架上的书有没有被列入 AI 采购清单。我本来觉得这事挺玄乎——上周刚看到新闻,AI 公司通过 ISBNdb 下单,一次买几千本甚至上百万本,扫描完直接粉碎销毁。我那几本泛黄的旧书,搞不好已经变成了 Claude 的训练数据。

直接搜了一下,ISBNdb 已经把 AI 采购页面撤了,但公开的图书查询接口还能用。我花半小时写了个脚本,跑了一遍自己书架上的 50 本书,结果 18 本被标记为“2022 年以前出版”,其中 3 本还是绝版教材。讲真,心里有点复杂。

这篇教程手把手教你从零开始,把自己的藏书过一遍筛子。不需要懂编程,跟着步骤走,大概 15 分钟搞定。

第一步:准备你的 ISBN 列表

ISBN 就是书脊或封底那串 13 位数字(也有老的 10 位)。每本书都有,像身份证号。你需要把想查的书都列出来,一行一个 ISBN。

操作流程:

1. 打开手机备忘录或电脑上的记事本。

2. 翻出每本书,找到 ISBN(通常在条形码上方)。如果找不到,可以用手机上的“扫一扫”功能识别条形码,系统会显示数字。

3. 把这些数字逐行输入,保存为 `books.txt` 文件。格式如下:

```

9787544291163

9787532768457

9787208061644

```

注意:不要加横线或空格,纯数字即可。如果书是 10 位的老 ISBN,后面加 `978` 和校验位变成 13 位,但大部分老书也能直接查到。

踩坑提醒:我一开始把书名和作者写进去了,但 ISBNdb 只认 ISBN 数字。所以只保留数字,一行一个。如果你有 100 本书,手动输入会累死人。建议用手机 OCR 软件拍书脊,自动提取 ISBN,亲测 准确率 90% 以上。

第二步:安装 Python 和必备工具

Python 是免费编程语言,有手就行。Windows 用户去官网下载安装包,macOS 用户打开终端输入 `brew install python3`(没有 Homebrew 的话先装)。Linux 用户自带 python3,跳过。

打开终端(Windows 是 cmd 或 PowerShell),依次输入以下命令按回车:

```

pip install requests

```

等它跑完就行。如果提示 `pip` 找不到,试试 `python3 -m pip install requests`。

新手常见错误:安装时输错单词,比如 `instal` 少了个 l。我当初就卡在这五分钟。复制粘贴最稳。

第三步:写脚本,跑查询

新建一个文件,命名为 `check_books.py`,用记事本打开,复制粘贴以下代码:

for isbn in isbns:

url = f"https://openlibrary.org/api/books?bibkeys=ISBN:{isbn}&format=json&jscmd=data"

r = requests.get(url)

data = r.json

if f"ISBN:{isbn}" in data:

book = data[f"ISBN:{isbn}"]

title = book.get("title", "未知书名")

pub_date = book.get("publish_date", "未知年份")

subjects = book.get("subjects", [])

subject_str = ", ".join([s["name"] for s in subjects[:3]])

print(f"ISBN:{isbn} | {title} | {pub_date} | 主题: {subject_str}")

else:

print(f"ISBN:{isbn} | 未查到")

time.sleep(1) # 避免请求过快被封

```

注意:这个脚本用的是 OpenLibrary 的公开 API,和 ISBNdb 不同,但数据更全,而且免费不限量。ISBNdb 的 API 需要付费,不推荐新手。

保存后,在终端里进入脚本所在目录(比如 `cd ~/Desktop`),然后输入:

```

python3 check_books.py

```

如果一切正常,你会看到一行一行输出,格式像这样:

```

ISBN:9787544291163 | 百年孤独 | 2011 | 主题: 文学, 魔幻现实主义

ISBN:9787532768457 | 深入理解计算机系统 | 2016 | 主题: 计算机科学

```

预期结果:每个 ISBN 对应一行,显示书名、出版年份和主题。如果查不到,多半是 ISBN 写错了,重新检查。

第四步:筛选出“高危书籍”

AI 公司采购清单里的核心特征是:2022 年以前出版、主题冷门(尤其是专业教材、绝版书)。把脚本输出结果复制到 Excel 或表格里,手动过滤。

我做了个简单表格,对比了自己的 50 本书:

类别 数量 说明
2022年及以后出版 32 相对安全,AI 公司不太要
2022年以前出版,非冷门 15 可能被关注,但风险较低
2022年以前出版,冷门/绝版 3 高危,建议拍照留存

踩坑:我一开始只看出版年份,忽略主题。后来发现一本 2005 年的《线性代数习题集》居然在 OpenLibrary 上标记为“稀有藏本”,立马长了个心眼。如果你的书在二手市场上能卖到原价 2 倍以上,大概率是目标。

第五步:实际保护措施

查到高危书之后,你可以做三件事:

1. 拍照扫描:用手机或扫描仪留存 PDF,至少内容不会消失。

2. 标记所有权:在书内页写“此版本禁止用于 AI 训练”,虽然法律效力存疑,但能表明态度。

3. 捐赠图书馆:一些大学图书馆会接收稀本书,比卖给二手商更安全。

加粗注意:千万别在闲鱼上低价甩卖你手中冷门旧书,很可能被 AI 公司的中间商扫货。我有个朋友 3 块钱卖了一本《化工原理》第三版,结果 ISBNdb 上同款二手价涨到 80 块,原因就是 AI 公司大量采购。

学到这一步,下一步可以试什么

你还可以把脚本升级一下,自动对比出版年份,输出高危列表到 CSV 文件,方便分享给朋友。或者用 ISBNdb 的公开搜索(直接访问网站,手动输入 ISBN)看有没有“批量采购记录”,虽然页面撤了,但部分历史数据可能还在。

留一个问题:你觉得 AI 公司粉碎旧书和谷歌扫描图书馆,本质区别在哪里?欢迎在评论区聊聊。

2 条回复

?
Ctrl + Enter 快速回复
Amy
Amy8月2日

刚试了WorkBuddy的自动化功能,感觉这种ISBN查重查源也能用workflow跑,不用自己写脚本… 你试过没?

投早的
投早的8月2日

等等,这个“2022年以前出版”是啥标准??AI公司真只看年份收书?我咋感觉这判断逻辑有点粗暴啊……不过思路不错,回头我也跑一下我的书看看