伟大的数据争夺战:为什么人工智能公司在购买旧书
简而言之:人工智能公司正在恐慌性购买2022年前出版的实体书籍。不是出于怀旧——而是为了生存。互联网现在是一份复印件的复印件,每一代基于人工智能输出训练的人工智能变得愚蠢。2022年前的书籍是最后一批可以证明是人类撰写的大规模文本语料库。Anthropic在“巴拿马计划”上花费了数百万——大量购买、切割书脊、扫描,然后销毁实体书,以建立一个法律上可辩护的人类数据库。联邦法官刚刚划定了界限:购买书籍,销毁原件,保留内部,你就没事。下载一个盗版PDF,你就会被起诉15亿美元。真正的故事并不是关于书籍。它是关于来源作为新的稀缺性在一个无限、毫无价值的内容时代。
这里是詹姆斯,水星科技解决方案的首席执行官。 香港 — 2026年8月
ISBNdb策略
一家名为ISBNdb的公司——一个书籍元数据的数据库,正如它的名字所示——最近开始为人工智能公司提供一项新服务:大宗实体书采购。
需要1000本书吗?他们会找到它们。需要100万本吗?他们会清空图书馆、二手书店和绝版目录。他们的推销词?"世界上最好的AI训练数据就藏在书架上。"
这里有个关键点:他们特别想要2022年前出版的书籍。
为什么设定这个截止日期?因为2022年11月是ChatGPT发布的时候。之后,互联网不再主要是人类创作的内容。它变成了一个递归的回声室——AI写作训练在AI写作上,训练在AI写作上。科技行业甚至为此创造了一个术语:"AI垃圾。"(中文翻译更为生动:AI泔水 — AI地沟油。)
复印问题
想象一下:你做了一份复印件。然后你复印那份复印件。接着你又复印那份复印件。那份复印件。首先消失的不是那些大而粗的标题,而是微妙的细节、边缘纹理、稀有的表情和少数派的观点。经过足够多的代际变化,一切都趋向于灰色糊状物。
人工智能研究人员称之为"模型崩溃。"这不是理论 — 它正在发生。每一个主要基于之前人工智能输出训练的新模型都会失去保真度。人类知识的长尾被削减。奇特的、利基的、真正原创的 — 一切都被平均化了。
合成数据本身并不是毒药。经过谨慎使用,结合人工策划和真实数据锚点,它可以发挥作用。但问题是:互联网再也无法告诉你什么是人类,什么是机器。这篇文章是由一个人写的吗?一个人工智能?一个由人重写的人工智能?一个由人工智能重写的人?来源链断裂了。
这使得一本在2021年——或1952年——印刷的实体书变得非常具体:一个可以证明是人类的工艺品。
巴拿马计划:Anthropic的15亿美元法律黑客
Claude背后的公司Anthropic并不是从购买书籍开始的。他们是从盗版开始的。
早期,他们从盗版网站下载了数百万本书。当版权风险升级时,他们迅速转变。自2024年起,他们花费数百万用于“巴拿马计划”——一个大规模购买实体书、切断书脊、通过高速扫描仪扫描页面、数字化内容的程序,然后销毁实体书籍。数字文件保留在Anthropic的内部数据库中,从未分发。
名字?没有官方解释。任务?听起来像电影宣传语:"破坏性地扫描世界上每一本书。"
作为一个书籍爱好者,我的直觉反应是厌恶。然后我读了法院裁决。
联邦法官的三部分测试
在Bartz诉Anthropic案中, 一位美国联邦法官将Anthropic的行为分为不同的法律类别:
第一部分 — 在书籍文本上进行训练:在这些特定事实下,属于合理使用。
第二部分 — 购买实体书 → 创建内部数字副本 → 销毁原件 → 不进行分发:同样属于合理使用。
第三部分 — 从盗版网站下载数百万本书 → 存储在中央数据库: 不属于合理使用。
同一本书。同样的培训目的。不同的法律结果。关键不在于“你付钱了吗?”——而在于整个过程:合法购买,单次转换,原件销毁,内部使用,不可分发。
Anthropic 最终以 $15 亿达成和解。这不是罚款——而是和解。这意味着他们计算出打官司的成本高于支付和解金。而 $15 亿仍然比与数百万作者和出版商谈判个别许可便宜。
这不是普遍适用的法律。这只是一个联邦地区法官的一个案件和一个解释。但这足以勾勒出一个操作手册。而 ISBNdb 看到了这个商业模式。
为什么 Claude 感觉更人性化
如果你使用过 Claude,你可能注意到了一些事情:它的写作往往感觉更自然,更贴近现实,更人类 比竞争对手更好。现在你知道原因了。当其他人在充满垃圾的互联网中训练时,Claude 部分地在数百万本真实书籍上进行了训练——真实的人类写作,经过编辑、策划、出版,包含了所有的混乱和具体性。
这15亿美元的和解为Anthropic带来了超越法律和平的东西:它验证了可证明的人类数据的市场。
真正的稀缺性不是内容——而是来源
这是重要的重新框架:
我们花了几十年认为数字解决了稀缺性。无限的副本。零边际成本。信息渴望自由。然后人工智能使内容生成几乎免费。我们现在可以生成无限的文本。无限的文本却没有任何意义。
但一本1952年的物理教科书——手写字体、手绘图表、散发着墨水气味的复印页——承载着AI无法生成的东西:一连串的人类判断。有人决定这个主题值得花费数年的时间。有人收集了材料。编辑选择了保留的内容。读者通过购买和引用投票。这本书是人类关注和决策的化石记录。
我上周在纽约大学的图书馆。拿起一本1952年的大一物理教材。每个图表、每个字体选择、每个页面布局——显然是手工制作的。就像一位老师手写了一份测试,然后通过复印机打印出来。虽然比AI生成的问题效率低,但在背后,你可以看到一个人的思考。
大多数大学图书馆的藏书没有数字足迹。互联网不知道它们的存在。这正是它们有价值的原因。
你的数据金矿
这不仅仅是关于书籍。每个拥有2022年前运营数据的企业都拥有一个来源资产。
• 一家时尚电商公司的买家照片——真实的人,真实的光线,真实的瑕疵
• 一家工厂的生产日志——真实的失败,真实的调整,真实的不确定性下的决策
• 2019年的客户服务记录——真实的挫折,真实的问题解决,真实的人际互动
最昂贵的数据不会是最机密的,也不会是最大的。它将是能够证明来源、谁认为它有价值以及为什么它值得信赖的数据。
新的价值方程
旧的方程:更多数据 = 更好的模型。
新公式:来源 × 人类判断 = 稀缺性 = 价值。
人工智能公司并不是在购买旧书,因为纸张胜过像素。它们在购买人性的证明。在一个机器可以生成无限可信文本的世界里,唯一重要的是是否有一个人真正写过它、思考过它、关心过它并完成了它。
停止囤积内容。开始囤积来源。
你书架上的书籍刚刚变成了一项战略资产。你在2022年之前的档案数据?那不是遗产——那是人类最后可验证的指纹。
水星科技解决方案:加速数字化。


