6 min remaining
0%
AI

大數據混戰:為什麼 AI 公司在購買舊書

AI 公司正在大量購買 2022 年之前的書籍來訓練模型。不是因為舊書特別——而是因為它們證明了人類確實寫過它們。在一個淹沒於 AI 垃圾的世界中,來源是新的稀缺。

6 min read
Progress tracked
6 分鐘閱讀·
AI Generated Cover for: The Great Data Scramble: Why AI Companies Are Buying Old Books

AI Generated Cover for: The Great Data Scramble: Why AI Companies Are Buying Old Books

大數據混戰:為什麼 AI 公司在購買舊書

簡而言之: AI 公司正在恐慌性地購買 2022 年之前出版的實體書籍。不是出於懷舊——而是為了生存。互聯網現在是一份影印件的影印件,而每一代基於 AI 輸出的 AI 都變得更愚蠢。2022 年之前的書籍是最後一批可證明由人類撰寫的大規模文本語料庫。Anthropic 在「巴拿馬計畫」上花費了數百萬——大量購買、切割書脊、掃描,然後銷毀實體書籍,以建立一個法律上可辯護的人類數據庫。一位聯邦法官剛剛劃定了界限:購買書籍,銷毀原件,保持內部,這樣你就安全了。下載盜版 PDF,你將面臨 15 億美元的訴訟。真正的故事不是關於書籍。這是關於來源作為新的稀缺性在一個無限且毫無價值的內容時代。

這裡是詹姆斯,水星科技解決方案的執行長。 香港 — 2026年8月

ISBNdb 陣線

一家公司名為 ISBNdb — 一本書的元資料資料庫,顧名思義 — 最近開始為 AI 公司提供一項新服務:大宗實體書籍採購。

需要 1,000 本書?他們會找到它們。需要 1 百萬本?他們會清空圖書館、二手書店和絕版目錄。他們的推銷詞?"世界上最好的 AI 訓練資料正靜靜地放在書架上。"

這裡有個重點:他們特別想要 2022 年之前出版的書籍。

為什麼要這個截止日期?因為 2022 年 11 月是 ChatGPT 上線的時候。在那之後,網路不再主要是人類撰寫的內容。它變成了一個遞歸的回音室——AI 寫作訓練在 AI 寫作上,訓練在 AI 寫作上。科技產業甚至為此創造了一個術語:"AI 垃圾。"(中文翻譯更具衝擊性:AI 泔水 — AI 地溝油。)

影印問題

想像成這樣:你做了一份影印本。然後你再影印那份影印本。接著你再影印那份影印本。份影印本。最先消失的不是那些大膽的標題,而是微妙的細節、邊緣的質感、稀有的表情和少數的觀點。經過足夠多的世代,一切都會趨向灰色的糊狀物。

AI 研究者稱這為"模型崩潰。"這不是理論 — 現在就正在發生。每一個主要基於之前 AI 輸出的新模型都會失去真實性。人類知識的長尾被削減了。那些奇特的、小眾的、真正原創的 — 都被平均化了。

合成數據本身並不是毒藥。若小心使用,並結合人類的策展和真實數據的錨點,它是可以運作的。但問題在於:互聯網再也無法告訴你什麼是人類,什麼是機器。這篇文章是由人寫的嗎?是人工智慧寫的嗎?是人重寫的人工智慧嗎?還是人工智慧重寫的人?來源鏈斷裂了。

這使得一本在2021年—或1952年—印刷的實體書變得非常具體:一個可證明是人類的工藝品。

巴拿馬計畫:Anthropic的15億美元法律黑客

Claude背後的公司Anthropic,並不是從購買書籍開始的。他們是從盜版開始的。

早期,他們從盜版網站下載了數百萬本書籍。當版權風險升高時,他們迅速轉變。從2024年開始,他們花費數百萬在"巴拿馬計畫"—一個批量購買實體書、切掉書脊、通過高速掃描儀掃描頁面、數位化內容的計畫,然後摧毀實體書籍。數位檔案保留在Anthropic的內部資料庫中,從未分發。

名稱?沒有官方解釋。任務?聽起來像電影標語:「破壞性掃描世界上每一本書。」

作為一個書籍愛好者,我的直覺反應是厭惡。然後我讀了法院的裁決。

聯邦法官的三部分測試

Bartz v. Anthropic, 一位美國聯邦法官將Anthropic的行為劃分為不同的法律類別:

第1部分 — 以書籍文本進行訓練: 在這些特定事實下的合理使用。

第2部分 — 購買實體書 → 創建內部數位副本 → 銷毀原本 → 不進行分發: 也屬於合理使用。

第3部分 — 從盜版網站下載數百萬本書 → 存儲在中央資料庫: 不屬於合理使用。

相同的書籍。相同的訓練目的。不同的法律結果。關鍵不在於「你有付錢嗎?」——而是整個過程:合法購買、單次轉換、原件銷毀、內部使用、無分發。

Anthropic 最終以 $15 億美元達成和解。這不是罰款——而是和解。這意味著他們計算過,打官司的成本比支付和解金更高。而 $15 億美元仍然比與數百萬作者和出版商談判個別授權便宜。

這不是普遍法律。這是一位聯邦地區法官、一個案件、一種解釋。但這足以勾勒出一個行動計畫。而 ISBNdb 看到了這個商業模式。

為什麼 Claude 感覺更像人類

如果你使用過 Claude,你可能注意到一點:它的寫作常常感覺更自然、更貼近現實、更人類比競爭對手更好。現在你知道為什麼了。在其他人訓練於充滿垃圾的互聯網時,Claude 部分地訓練於數百萬本實際書籍——真實的人類寫作,經過編輯、策劃、出版,並且包含所有的混亂和具體性。

這15億美元的和解為Anthropic帶來了超越法律和平的東西:它驗證了可證明的人類數據的市場。

真正的稀缺性不是內容——而是來源

這是重要的重新框架:

我們花了幾十年認為數位解決了稀缺性。無限的複製。零邊際成本。資訊想要自由。然後AI使內容生成幾乎變得免費。我們現在可以生成無限的文本。無限的文本卻什麼都不說。

但一本1952年的物理教科書——手寫字體、手繪圖表、散發著墨水氣味的複印頁——承載著AI無法生成的東西:一連串的人類判斷。有人決定這個主題值得花費數年的時間。有人收集了資料。編輯選擇了保留的內容。讀者用購買和引用進行投票。這本書是人類注意力和決策的化石記錄。

我上週在NYU的圖書館。拿起一本1952年的大一物理教材。每個圖表、每個字體選擇、每個頁面佈局——顯然是手工編排的。就像一位老師手寫考卷,然後通過複印機印刷。雖然比AI生成的問題效率低,但在背後,你可以看到一個人的思考。

大多數大學圖書館的館藏沒有數位足跡。互聯網不知道它們的存在。這正是它們有價值的原因。

你的資料金礦

這不僅僅是關於書籍。每個擁有2022年前營運資料的企業都擁有一項來源資產。

• 一家時尚電子商務公司的買家照片 — 真實的人類、真實的光線、真實的瑕疵

• 一家工廠的生產記錄 — 真實的失敗、真實的調整、在不確定性下的真實決策

• 2019年的客服對話紀錄 — 真實的挫折、真實的問題解決、真實的人際互動

最昂貴的資料不一定是最秘密的,或是最大的。它將是能證明來源、誰評價其價值以及為何值得信賴的資料。

新的價值方程式

舊的方程式:更多資料 = 更好的模型。

新方程式:來源 × 人類判斷 = 稀缺性 = 價值。

AI 公司並不是因為紙張勝過像素而購買舊書。他們購買的是人性的證明。在一個機器可以生成無限可信文本的世界裡,唯一重要的是是否真的有人寫過、思考過、關心過並完成了它。

停止囤積內容。開始囤積來源。

你書架上的書籍剛剛變成了一項戰略資產。你在 2022 年之前的檔案資料?那不是遺產——那是人類最後可驗證的指紋。

水星科技解決方案:加速數位化。