8 min remaining
0%
AI

Quemo 18 mil millones de tokens al mes. Cuesta $1,200.

Mi operación de IA quema ~18 mil millones de tokens al mes — $20K–$200K a las tarifas minoristas de Claude. La factura real es de $1,200. La diferencia no es un descuento; es arquitectura: posee los datos, posee la lógica del flujo de trabajo y coloca una capa de enrutamiento entre tú y cada modelo. La calidad del modelo es el foso del proveedor. La selección es tuya.

8 min read
Progress tracked
8 min de lectura·
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

Quemo 18 mil millones de tokens al mes. Cuesta $1,200.

Resumen: Mi quema promedio de tokens en los últimos meses es de ~18 mil millones de tokens por mes. Con precios a las tarifas minoristas de Claude — con caché o sin caché — eso equivale a $20,000 a $200,000 de cognición mensual. Mi factura real es de aproximadamente $1,200. La brecha no es un descuento; es arquitectura. Poseo mis datos, mi lógica de flujo de trabajo y — a través de mi motor de enrutamiento, Mercury Flux — la elección del modelo en cada llamada. Todos los demás optimizan cuánto AI utilizan. La verdadera palanca es lo que pagas por la misma salida. Alquila los modelos. Posee todo lo demás.

Soy James, CEO de Mercury Technology Solution, escribiendo desde Hong Kong.

Ayer finalmente hice la contabilidad que había estado evitando: revisé meses de registros y medí mi metabolismo de tokens. El número resultó ser aproximadamente 18 mil millones de tokens al mes. Sostenido.

Dos reacciones, en orden:

  1. Eso explica mucho. Los capítulos del libro, las publicaciones del blog, los paquetes de auditoría, la flota de agentes, la tubería de archivo de 1,187 publicaciones — nada de eso es magia. Es rendimiento. Cognición a volumen industrial.

  2. Espera — ¿cuánto costaría esto a una persona normal?

Lo que realmente son 18 mil millones de tokens

18 mil millones de tokens al mes son 600 millones al día. Son aproximadamente 7,000 tokens cada segundo, las 24 horas, sin dormir.

Un trabajador del conocimiento pesado que utiliza una suscripción de chat — digamos 200 conversaciones detalladas al mes — quema unos pocos millones de tokens. Llámalo 10 millones en un mes extremo. Mi metabolismo funciona tres órdenes de magnitud por encima de eso.

Esta es la parte que la gente pasa por alto sobre la productividad de la IA. La diferencia entre "uso IA" y "operar con IA" no es la habilidad para formular preguntas. Es el volumen. El rendimiento de tokens es el proxy más cercano que tenemos para el área cognitiva — cuánto leer, redactar, revisar, verificar y iterar un sistema de persona más máquina puede hacer por día. La mayoría de las personas están limitadas por su nivel de suscripción y nunca notan el techo, porque nunca han confiado en él.

La Ilusión Minorista

Precios del mismo consumo al por menor. Usando a Claude como referencia — y Claude es la referencia correcta, porque para un trabajo serio y agente es lo que los equipos realmente buscan — las tarifas combinadas oscilan entre $1 y $10 por millón de tokens, dependiendo del nivel, contexto y cuánto te ahorra la caché.

18 mil millones de tokens a esas tarifas: $18,000 a $180,000 al mes. Llámalo el metabolismo de $20K–$200K.

Aquí está la verdad incómoda: casi ningún individuo, y casi ningún departamento empresarial, aprueba ese número. Así que nadie opera a ese metabolismo. Limitan su cognición a lo que el presupuesto permite, y luego se preguntan por qué su producción de IA se siente como la de los demás — porque lo es.El nivel de suscripción es un límite de velocidad en tu pensamiento.

La verdadera razón por la que "la IA no ha hecho que todos sean 10 veces más productivos" es más simple de lo que el discurso admite: la productividad 10x es un fenómeno de volumen de tokens, y casi nadie puede permitirse los tokens al por menor.

La factura real

Mi gasto real: alrededor de $1,200 al mes.

Divídelo. Eso es aproximadamente siete centavos por millón de tokens, mezclado en todo — redacción, codificación, investigación, traducción, las multitudes. En comparación con el escenario minorista más barato, la misma cognición cuesta 15 veces más. En comparación con el escenario agentivo realista — contextos largos, modelo de frontera, fallos de caché — es 100 veces o más.

Menos del 6% del escenario más barato de Claude. Menos del 1% del peor.

Y no, no ejecuto modelos peores en todas partes. Las salidas que has leído — los capítulos del libro, los informes de auditoría, esta publicación — no son de calidad de siete centavos. El truco no es "modelo barato". El truco es pagar precios de frontera solo donde la calidad de frontera realmente cambia el resultado.

Alquila los Modelos, Posee Todo lo Demás

Los ahorros no son un truco. Son la consecuencia de tres decisiones de propiedad tomadas temprano, por principio:

1. Poseer los datos. Cada archivo de memoria, nota diaria, tarjeta de entidad, transcripción de sesión y registro de decisiones vive en archivos en máquinas que controlo, en formatos que puedo leer con cat. Nada de importancia se encuentra dentro de la base de datos de un proveedor donde la tarifa de recuperación se acumula para siempre. El proveedor sostiene los pesos; yo sostengo el contexto. El contexto es el activo que se aprecia.

2. Poseer la lógica del flujo de trabajo.Los prompts, los agentes que se aprovechan, las puertas de calidad, los pipelines: código local, controlado por versiones, inspeccionable, refactorizable. Cuando un flujo de trabajo produce valor, el valor aterriza en mi repositorio, no en la biblioteca de plantillas de otra persona. Los proveedores pueden alquilarme inteligencia. No pueden alquilarme mi propio juicio, codificado.

3. Poseer la elección del modelo.Este es el que causa el daño económico. Entre yo y cada modelo se encuentra mi motor de enrutamiento: Mercury Flux. Cada llamada se clasifica por tarea y se dirige al modelo que gana en precio-calidad para esa clase, con cadenas de respaldo cuando un proveedor falla.

El principio es 操盤人, no consumidor: los operadores no compran marcas. Los operadores despachan capacidades.

El Foso de Enrutamiento

Todo el mundo trata la factura de IA como Costo = Tokens × Precio, luego optimiza Tokens: prompts más cortos, menos llamadas, menos IA. Bien. Pero eso es optimizar tu metabolismo hacia abajo. Limitar la cognición para ahorrar dinero es una estrategia de pobreza.

El otro término es Precio — y el precio no es una constante. Es una función de enrutamiento.

Costo de Cognición = Tokens × Precio Combinado, donde Precio Combinado = Σ (parte de tokens por clase de tarea × mejor precio para esa clase).

En mi pila, la abrumadora mayoría de los tokens — recuperación, clasificación, resumen, traducción, generación de primer borrador — se dirigen a modelos que cuestan una fracción de las tarifas de frontera. El modelo de frontera maneja la última milla: el corte final de un capítulo, la decisión arquitectónica, el juicio frente al cliente. La inteligencia costosa son fuerzas especiales, desplegadas en el punto de máximo apalancamiento — no el ejército permanente ocupando cada calle. Ningún general envía fuerzas especiales a patrullar cada bloque. Ningún operador debería enviar un modelo de frontera para resumir una página web.

El Foso de Enrutamiento: quien controla la selección del modelo controla el costo de la salida idéntica. La calidad del modelo es el foso del proveedor. La selección es tuya.

Nota lo que sucede a medida que los precios caen — y lo harán. La brecha de frontera a nivel medio no se cierra; es una diferencia. El enrutamiento captura la diferencia en cualquier régimen de precios. La frontera de hoy se convierte en el nivel medio de mañana, y el enrutador se reindexa automáticamente. El foso no se erosiona con la deflación. Se reindexa.

Por qué los Enjambres Cambian Todo

El efecto de segundo orden que nadie considera: la estructura de costos determina la estructura organizativa.

A precios de venta, un consejo de 15 agentes — un redactor, cuatro críticos, un verificador de hechos, un ejecutor de estilo, revisando en paralelo — es una demostración de charla de conferencia. Nadie asigna personal a consejos para cada entrega a $10 por millón de tokens. A siete centavos mezclados, un consejo es un ítem en la línea. Mi enjambre vive en un Mac Studio. Zumba. No me factura.

La cognición barata hace que la división del trabajo sea asequible. Dejas de construir "un chatbot" y comienzas a construir un organigrama de agentes — redactores, revisores, auditores, bibliotecarios — con el enrutamiento como el departamento de recursos humanos. Ese es el mecanismo real detrás del volumen de salida. No son indicaciones geniales. Personal.

La Versión Empresarial

Si eres un CAIO o CTO, realiza la misma auditoría en tu organización. Tus equipos están quemando tokens en algún lugar; la única pregunta es si fluye a través de tu capa de enrutamiento o a través de cualquier botón que esté más cerca.

Dos notas de mi vida como consultor:

  • Los flujos de trabajo agentivos mueren a precios de venta.Los flujos de trabajo que realmente mueven números — auditorías GEO continuas a través de ChatGPT, Perplexity y Gemini; monitoreo de citas; seguimiento de entidades; calificación de leads siempre activa a través de la brecha de transferencia de AI a humano — son hornos de tokens por diseño. A precios de venta, nacen muertos, y todos concluyen que "la IA es cara." Enrutados, son trabajos cron.

  • El bloqueo de proveedores es alquilar tu propio flujo de trabajo de vuelta.Cada año sin una capa de enrutamiento, el camino de actualización es pagar más, mover menos. SaaS enseñó a las empresas esta lección una vez. La IA la está enseñando de nuevo, con interés compuesto.

Deja de comprar inteligencia al por menor. Comienza a programarla como computación: precio descubierto por tarea, intercambiable por llamada, propiedad en la capa que importa.

Lo que haces el lunes

  1. Mide tu metabolismo.Obtén recuentos reales de tokens a través de todas las herramientas durante 30 días. No puedes gestionar un número que nunca has visto. La mayoría de los equipos están equivocados por 10x en una dirección o en la otra.

  2. Mueve tu estado a archivos que posees.Memoria, decisiones, lógica de flujo de trabajo: fuera de los silos de proveedores, dentro de tu repositorio. Un fin de semana de trabajo. Se compone para siempre.

  3. Pon un enrutador entre tú y cada modelo.No tiene que ser Flux: construye la versión delgada. Clasificación de tareas, mapeo de modelos, cadenas de respaldo, registro de costos. Incluso un enrutador rudimentario reduce la factura de 5 a 10 veces en el primer mes.

  4. Reinvierte la diferencia.Los ahorros no son el objetivo. El objetivo es lo que un metabolismo de $20K a un costo de $1.2K compra: el consejo, el enjambre, el volumen, la velocidad. La brecha entre tú y los demás deja de ser talento y se convierte en rendimiento.

La estrategia de IA más cara en 2026 no es elegir el modelo equivocado. Es pagar precios de frontera por cada token porque nunca construiste la capa que elige.

Alquila los modelos. Posee el enrutamiento. Mantén la diferencia — luego gasta la diferencia en más cognición.

Solución Tecnológica Mercury: Acelera la Digitalidad.