6 min remaining
0%
AI

La grande course aux données : Pourquoi les entreprises d'IA achètent des livres anciens

Les entreprises d'IA achètent en masse des livres publiés avant 2022 pour entraîner des modèles. Non pas parce que les vieux livres sont spéciaux — mais parce qu'ils prouvent qu'un humain les a réellement écrits. Dans un monde noyé dans la bouillie de l'IA, la provenance est la nouvelle rareté.

6 min read
Progress tracked
6 min de lecture·
AI Generated Cover for: The Great Data Scramble: Why AI Companies Are Buying Old Books

AI Generated Cover for: The Great Data Scramble: Why AI Companies Are Buying Old Books

La grande course aux données : Pourquoi les entreprises d'IA achètent des livres anciens

TL;DR : Les entreprises d'IA achètent frénétiquement des livres physiques publiés avant 2022. Non pas par nostalgie — mais pour survivre. Internet est désormais une photocopie d'une photocopie, et chaque génération d'IA formée sur des sorties d'IA devient plus stupide. Les livres publiés avant 2022 sont le dernier corpus de textes prouvablement écrits par des humains à grande échelle. Anthropic a dépensé des millions dans le "Projet Panama" — achetant en masse, coupant les dos, numérisant, puis détruisant des livres physiques pour construire un coffre-fort de données humaines légalement défendable. Un juge fédéral vient de tracer la ligne : achetez le livre, détruisez l'original, gardez-le en interne, et vous êtes en règle. Téléchargez un PDF pirate et vous êtes poursuivi pour 1,5 milliard de dollars. La vraie histoire ne concerne pas les livres. Elle concerne la provenance comme la nouvelle rareté dans une ère de contenu infini et sans valeur.

James ici, PDG de Mercury Technology Solutions. Hong Kong — août 2026

Le Gambit ISBNdb

Une entreprise appelée ISBNdb — une base de données de métadonnées de livres, exactement ce que cela semble être — a récemment commencé à offrir un nouveau service aux entreprises d'IA : approvisionnement en livres physiques en gros.

Besoin de 1 000 livres ? Ils les trouveront. Besoin de 1 million ? Ils videront des bibliothèques, des librairies d'occasion et des catalogues épuisés. Leur argument ? "Les meilleures données d'entraînement en IA du monde sont sur des étagères."

Voici le hic : ils veulent spécifiquement des livres publiés avant 2022.

Pourquoi cette date limite ? Parce que novembre 2022 est le moment où ChatGPT a été lancé. Après cela, Internet a cessé d'être principalement écrit par des humains. C'est devenu une chambre d'écho récursive — une écriture IA entraînée sur une écriture IA entraînée sur une écriture IA. L'industrie technologique a même inventé un terme pour cela : "AI slop." (La traduction chinoise est plus viscérale : AI泔水 — huile de gouttière IA.)

Le problème de la photocopie

Pensez-y comme ceci : vous faites une photocopie. Ensuite, vous photocopiez la photocopie. Puis vous photocopiez cette photocopie. Ce qui disparaît en premier, ce ne sont pas les gros titres en gras — ce sont les détails subtils, les textures des bords, les expressions rares, les perspectives minoritaires. Après suffisamment de générations, tout converge vers une bouillie grise.cela photocopie. Ce qui disparaît en premier, ce ne sont pas les gros titres en gras — ce sont les détails subtils, les textures des bords, les expressions rares, les perspectives minoritaires. Après suffisamment de générations, tout converge vers une bouillie grise.

Les chercheurs en IA appellent cela "l'effondrement du modèle." Ce n'est pas théorique — cela se produit maintenant. Chaque nouveau modèle entraîné principalement sur les sorties précédentes de l'IA perd en fidélité. La longue traîne du savoir humain est rasée. Le bizarre, le niche, le véritablement original — tout est moyenné.

Les données synthétiques elles-mêmes ne sont pas toxiques. Utilisées avec soin, avec une curation humaine et des ancres de données réelles, elles peuvent fonctionner. Mais voici le problème : l'internet ne peut plus vous dire ce qui est humain et ce qui est machine.Cet article est-il écrit par une personne ? Une IA ? Une IA réécrite par une personne ? Une personne réécrite par une IA ? La chaîne de provenance est rompue.

Ce qui fait qu'un livre physique imprimé en 2021 — ou en 1952 — est quelque chose de très spécifique : un artefact humain prouvable.

Anthropic, la société derrière Claude, n'a pas commencé par acheter des livres. Ils ont commencé par la piraterie.

Au début, ils ont téléchargé des millions de livres depuis des sites pirates. Lorsque le risque de violation de droits d'auteur a augmenté, ils ont pivoté rapidement. À partir de 2024, ils ont dépensé des millions sur "Projet Panama" — un programme pour acheter des livres physiques en gros, couper leurs dos, faire passer les pages à travers des scanners haute vitesse, numériser le contenu, puis détruire les livres physiques.Les fichiers numériques restent dans la base de données interne d'Anthropic, jamais distribués.

Le nom ? Pas d'explication officielle. La mission ? Ça ressemble à un slogan de film : "Numériser de manière destructive chaque livre dans le monde."

En tant que passionné de livres, ma réaction instinctive a été le dégoût. Puis j'ai lu le jugement du tribunal.

Le test en trois parties du juge fédéral

Dans Bartz c. Anthropic, un juge fédéral américain a divisé les actions d'Anthropic en catégories juridiques distinctes :

Partie 1 — Formation sur le texte du livre : Utilisation équitable, dans ces faits spécifiques.

Partie 2 — Acheter un livre physique → créer une copie numérique interne → détruire l'original → pas de distribution : Également une utilisation équitable.

Partie 3 — Télécharger des millions de livres depuis des sites pirates → stocker dans une base de données centrale : PAS une utilisation équitable.

Même livre. Même objectif de formation. Résultat légal différent. La ligne n'est pas "avez-vous payé pour cela ?" — c'est l'ensemble : achat légal, conversion unique, destruction originale, usage interne, pas de distribution.

Anthropic a finalement réglé les revendications de piraterie pour 1,5 milliard de dollars. Pas une amende — un règlement. Cela signifie qu'ils ont calculé que se battre était pire que de payer. Et 1,5 milliard de dollars était encore moins cher que de négocier des licences individuelles avec des millions d'auteurs et d'éditeurs.

Ce n'est pas une loi universelle. C'est un juge fédéral de district, une affaire, une interprétation. Mais c'est suffisant pour esquisser un plan d'action. Et ISBNdb a vu le modèle commercial.

Pourquoi Claude se sentait plus humain

Si vous avez utilisé Claude, vous avez peut-être remarqué quelque chose : son écriture semblait souvent plus naturelle, plus ancrée, plus humain que les concurrents. Maintenant vous savez pourquoi. Alors que d'autres se sont entraînés sur un internet rempli de déchets, Claude a été partiellement formé sur des millions de livres réels — une véritable écriture humaine, éditée, organisée, publiée, avec tout le désordre et la spécificité que cela implique.

Le règlement de 1,5 milliard de dollars a acheté à Anthropic quelque chose de plus qu'une paix légale : il a validé le marché des données prouvablement humaines.

La véritable rareté n'est pas le contenu — c'est la provenance

Voici le recadrage qui compte :

Nous avons passé des décennies à penser que le numérique résolvait la rareté. Des copies infinies. Coût marginal nul. L'information veut être libre. Et puis l'IA a rendu la génération de contenu pratiquement gratuite. Nous pouvons produire un texte infini maintenant.Un texte infini qui ne dit rien.

Mais un manuel de physique de 1952 — polices manuscrites, diagrammes dessinés à la main, pages duplicées sentant l'encre — porte quelque chose qu'aucune IA ne peut générer : une chaîne de jugement humain. Quelqu'un a décidé que ce sujet valait des années de travail. Quelqu'un a rassemblé des matériaux. Un éditeur a choisi ce qui restait. Les lecteurs ont voté avec leurs achats et leurs citations. Le livre est un enregistrement fossile de l'attention humaine et de la prise de décision humaine.

J'étais à la bibliothèque de NYU la semaine dernière. J'ai pris un manuel de physique pour les étudiants de première année de 1952. Chaque diagramme, chaque choix de police, chaque mise en page — clairement composé à la main. Comme un enseignant qui a écrit un test à la main, puis l'a passé dans un tambour de duplicateur. Moins efficace que des questions générées par IA, c'est sûr. Mais derrière cela, vous pouvez voir la pensée d'une personne.

La plupart des collections de bibliothèques universitaires n'ont aucune empreinte numérique. Internet ne sait pas qu'elles existent. C'est précisément pourquoi elles sont précieuses.

Votre mine d'or de données

Ce n'est pas seulement une question de livres. Chaque entreprise disposant de données opérationnelles antérieures à 2022 possède un actif de provenance.

• Les photos d'acheteurs d'une entreprise de mode en ligne — de vraies personnes, un éclairage réel, de vraies imperfections

• Les journaux de production d'une usine — de vrais échecs, de vrais ajustements, de vraies décisions dans l'incertitude

• Les transcriptions du service client de 2019 — de la vraie frustration, de la vraie résolution de problèmes, de vraies interactions humaines

Les données les plus coûteuses ne seront pas les plus secrètes. Ni les plus volumineuses.Ce sera les données qui peuvent prouver d'où elles viennent, qui les a jugées dignes, et pourquoi elles sont fiables.

La Nouvelle Équation de Valeur

L'ancienne équation : Plus de données = Meilleurs modèles.

La nouvelle équation : Provenance × Jugement humain = Rareté = Valeur.

Les entreprises d'IA n'achètent pas de vieux livres parce que le papier bat les pixels. Elles achètent la preuve d'humanité. Dans un monde où les machines peuvent générer un texte plausible infini, la seule chose qui compte est de savoir si un humain l'a réellement écrit, y a pensé, et a eu assez de soin pour le terminer.

Cessez de thésauriser du contenu. Commencez à thésauriser la provenance.

Les livres sur votre étagère viennent de devenir un atout stratégique. Les données dans vos archives d'avant 2022 ? Ce n'est pas un héritage — c'est la dernière empreinte vérifiable de l'humanité.

Mercury Technology Solutions : Accélérez la digitalité.