La Gran Carrera de Datos: Por Qué las Empresas de IA Están Comprando Libros Antiguos
Resumen: Las empresas de IA están comprando libros físicos publicados antes de 2022 en un estado de pánico. No por nostalgia, sino por supervivencia. Internet es ahora una fotocopia de una fotocopia, y cada generación de IA entrenada con salida de IA se vuelve más tonta. Los libros anteriores a 2022 son el último corpus de texto comprobablemente escrito por humanos a gran escala. Anthropic gastó millones en "Proyecto Panamá": comprando en masa, cortando lomos, escaneando y luego destruyendo libros físicos para construir un vault de datos humanos legalmente defendible. Un juez federal acaba de marcar la línea: compra el libro, destruye el original, mantenlo interno y estás a salvo. Descarga un PDF pirata y te demandan por 1.5 mil millones de dólares. La verdadera historia no trata sobre libros. Se trata de la procedencia como la nueva escasez en una era de contenido infinito y sin valor.
James aquí, CEO de Mercury Technology Solutions. Hong Kong — agosto de 2026
La Estrategia ISBNdb
Una empresa llamada ISBNdb — una base de datos de metadatos de libros, exactamente lo que suena — recientemente comenzó a ofrecer un nuevo servicio a las empresas de IA: adquisición masiva de libros físicos.
¿Necesitas 1,000 libros? Los encontrarán. ¿Necesitas 1 millón? Vaciarán bibliotecas, librerías de segunda mano y catálogos fuera de impresión. ¿Su propuesta?"Los mejores datos de entrenamiento de IA del mundo están sentados en estantes."
Aquí está el truco: específicamente quieren libros publicados antes de 2022.
¿Por qué ese límite? Porque noviembre de 2022 es cuando ChatGPT se lanzó. Después de eso, Internet dejó de ser principalmente escrito por humanos. Se convirtió en una cámara de eco recursiva: escritura de IA entrenada en escritura de IA entrenada en escritura de IA. La industria tecnológica incluso acuñó un término para ello: "basura de IA." (La traducción al chino es más visceral: AI泔水 — aceite de alcantarilla de IA.)
El Problema de la Fotocopia
Piénsalo así: haces una fotocopia. Luego fotocopias la fotocopia. Luego fotocopias esa fotocopia. Lo que desaparece primero no son los grandes titulares en negrita, sino los detalles sutiles, las texturas de los bordes, las expresiones raras, las perspectivas minoritarias. Después de suficientes generaciones, todo converge en un puré gris.
Los investigadores de IA llaman a esto "colapso del modelo." No es teórico: está sucediendo ahora. Cada nuevo modelo entrenado principalmente con la salida de IA anterior pierde fidelidad. La larga cola del conocimiento humano se va recortando. Lo extraño, lo de nicho, lo genuinamente original: todo se promedia.
Los datos sintéticos en sí no son veneno. Usados con cuidado, con curaduría humana y anclajes de datos reales, pueden funcionar. Pero aquí está el problema: internet ya no puede decirte qué es humano y qué es máquina.¿Está este artículo escrito por una persona? ¿Una IA? ¿Una IA reescrita por una persona? ¿Una persona reescrita por una IA? La cadena de procedencia está rota.
Lo que convierte un libro físico impreso en 2021 — o 1952 — en algo muy específico: un artefacto comprobablemente humano.
Proyecto Panamá: El hack legal de 1.5 mil millones de dólares de Anthropic
Anthropic, la empresa detrás de Claude, no comenzó comprando libros. Comenzaron con la piratería.
Al principio, descargaron millones de libros de sitios piratas. Cuando el riesgo de derechos de autor aumentó, cambiaron de rumbo drásticamente. A partir de 2024, gastaron millones en "Proyecto Panamá" — un programa para comprar libros físicos al por mayor, cortar sus lomos, alimentar las páginas a través de escáneres de alta velocidad, digitalizar el contenido, luego destruir los libros físicos.Los archivos digitales permanecen en la base de datos interna de Anthropic, nunca se distribuyen.
¿El nombre? Sin explicación oficial. ¿La misión? Suena como un eslogan de película: "Escanear destructivamente cada libro en el mundo."
Como amante de los libros, mi reacción instintiva fue de asco. Luego leí la sentencia del tribunal.
La Prueba de Tres Partes del Juez Federal
En Bartz v. Anthropic, un juez federal de EE. UU. dividió las acciones de Anthropic en distintas categorías legales:
Parte 1 — Entrenamiento con texto de libros: Uso justo, bajo estos hechos específicos.
Parte 2 — Comprar libro físico → crear copia digital interna → destruir original → no distribución: También uso justo.
Parte 3 — Descargar millones de libros de sitios piratas → almacenar en base de datos central: NO uso justo.
Mismo libro. Mismo propósito de entrenamiento. Diferente resultado legal. La línea no es "¿pagaste por ello?" — es la pila completa: compra legal, conversión única, destrucción original, uso interno, sin distribución.
Anthropic finalmente resolvió las reclamaciones de piratería por $1.5 mil millones. No es una multa — es un acuerdo. Lo que significa que calcularon que pelear era peor que pagar. Y $1.5 mil millones seguía siendo más barato que negociar licencias individuales con millones de autores y editores.
Esto no es una ley universal. Es un juez de distrito federal, un caso, una interpretación. Pero es suficiente para esbozar un manual de estrategias. Y ISBNdb vio el modelo de negocio.
Por qué Claude se sentía más humano
Si has usado Claude, podrías haber notado algo: su escritura a menudo se sentía más natural, más arraigada, más humano que los competidores. Ahora sabes por qué. Mientras otros se entrenaron en un internet lleno de desorden, Claude fue parcialmente entrenado en millones de libros reales: escritura humana real, editada, curada, publicada, con toda la desorden y especificidad que eso conlleva.
El acuerdo de $1.5 mil millones le compró a Anthropic algo más allá de la paz legal: validó el mercado para datos comprobablemente humanos.
La verdadera escasez no es el contenido, sino la procedencia
Aquí está el replanteamiento que importa:
Hemos pasado décadas pensando que lo digital resolvía la escasez. Copias infinitas. Costo marginal cero. La información quiere ser libre. Y luego la IA hizo que la generación de contenido fuera prácticamente gratuita. Ahora podemos producir texto infinito.Texto infinito que no dice nada.
Pero un libro de texto de física de 1952 — fuentes escritas a mano, diagramas dibujados a mano, páginas mimeografiadas que huelen a tinta — lleva algo que ninguna IA puede generar: una cadena de juicio humano. Alguien decidió que este tema valía años de trabajo. Alguien reunió materiales. Un editor eligió lo que se quedó. Los lectores votaron con compras y citas. El libro es un registro fósil de la atención humana y la toma de decisiones humanas.
Estuve en la biblioteca de NYU la semana pasada. Tomé un texto de física para principiantes de 1952. Cada diagrama, cada elección de fuente, cada diseño de página — claramente compuesto a mano. Como un profesor que escribió un examen a mano, luego lo pasó por un tambor mimeógrafo. Menos eficiente que las preguntas generadas por IA, seguro. Pero detrás de ello, puedes ver el pensamiento de una persona.
La mayoría de las colecciones de bibliotecas universitarias no tienen ninguna huella digital. Internet no sabe que existen. Lo cual es precisamente por lo que son valiosas.
Tu mina de datos de oro
Esto no se trata solo de libros. Cada negocio que tiene datos operativos anteriores a 2022 posee un activo de procedencia.
• Las fotos de compradores de una empresa de comercio electrónico de moda — humanos reales, iluminación real, imperfecciones reales
• Los registros de producción de una fábrica — fallos reales, ajustes reales, decisiones reales bajo incertidumbre
• Transcripciones de servicio al cliente de 2019 — frustración real, resolución de problemas real, interacción humana real
Los datos más caros no serán los más secretos. Ni los más grandes.Serán los datos que pueden probar de dónde provienen, quién los consideró valiosos y por qué son confiables.
La Nueva Ecuación de Valor
La antigua ecuación: Más datos = Mejores modelos.
La nueva ecuación: Proveniencia × Juicio humano = Escasez = Valor.
Las empresas de IA no están comprando libros antiguos porque el papel supera a los píxeles. Están comprando prueba de humanidad. En un mundo donde las máquinas pueden generar texto plausible infinito, lo único que importa es si un humano realmente lo escribió, lo pensó, se preocupó lo suficiente como para terminarlo.
Deja de acumular contenido. Comienza a acumular proveniencia.
Los libros en tu estante acaban de convertirse en un activo estratégico. ¿Los datos en tus archivos de antes de 2022? Eso no es legado — eso es la última huella dactilar verificable de la humanidad.
Mercury Technology Solutions: Acelera la Digitalidad.

