8 min remaining
0%
AI

Je brûle 18 milliards de jetons par mois. Cela coûte 1 200 $.

Mon opération d'IA brûle ~18 milliards de jetons par mois — 20 000 $–200 000 $ aux tarifs de détail de Claude. La facture réelle est de 1 200 $. La différence n'est pas une remise ; c'est de l'architecture : possédez les données, possédez la logique de flux de travail, et mettez une couche de routage entre vous et chaque modèle. La qualité du modèle est le rempart du fournisseur. La sélection vous appartient.

8 min read
Progress tracked
8 min de lecture·
AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

AI Generated Cover for: I Burn 18 Billion Tokens a Month. It Costs $1,200.

Je brûle 18 milliards de jetons par mois. Cela coûte 1 200 $.

TL;DR : Ma consommation moyenne de jetons au cours des derniers mois est d'environ 18 milliards de jetons par mois. Prix au détail de Claude — avec ou sans cache — cela représente 20 000 $ à 200 000 $ de cognition mensuelle. Ma facture réelle est d'environ 1 200 $. L'écart n'est pas une remise ; c'est de l'architecture. Je possède mes données, ma logique de flux de travail, et — grâce à mon moteur de routage, Mercury Flux — le choix du modèle à chaque appel. Tout le monde optimise la quantité d'IA qu'il utilise. Le véritable levier est ce que vous payez pour le même résultat. Louez les modèles. Possédez tout le reste.

Je suis James, PDG de Mercury Technology Solution, écrivant depuis Hong Kong.

Hier, j'ai enfin fait la comptabilité que j'avais évitée : j'ai extrait des mois de journaux et mesuré mon métabolisme de jetons. Le chiffre est revenu à environ 18 milliards de jetons par mois. Soutenu.

Deux réactions, dans l'ordre :

  1. Cela explique beaucoup de choses. Les chapitres de livres, les articles de blog, les packs d'audit, la flotte d'agents, le pipeline d'archives de 1 187 publications — rien de tout cela n'est magique. C'est du débit. Cognition à volume industriel.

  2. Attendez — combien cela coûterait-il à une personne normale ?

Ce que 18 milliards de jetons représentent réellement

18 milliards de jetons par mois, c'est 600 millions par jour. C'est environ 7 000 jetons chaque seconde, jour et nuit, sans sommeil.

Un travailleur du savoir intensif utilisant un abonnement de chat — disons 200 conversations détaillées par mois — consomme quelques millions de jetons. Appelons cela 10 millions lors d'un mois extrême. Mon métabolisme fonctionne trois ordres de grandeur au-dessus de cela.

C'est la partie que les gens manquent à propos de la productivité de l'IA. La différence entre "J'utilise l'IA" et "Je fonctionne avec l'IA" n'est pas une question de compétence en prompt. C'est une question de volume. Le débit de tokens est le meilleur indicateur que nous avons pour la surface cognitive — combien de lecture, de rédaction, de révision, de vérification croisée et d'itération un système homme-plus-machine peut faire par jour. La plupart des gens sont limités par leur niveau d'abonnement et ne remarquent jamais le plafond, car ils ne s'y sont jamais appuyés.

L'Illusion du Commerce de Détail

Tarifiez la même combustion au détail. En utilisant Claude comme référence — et Claude est la bonne référence, car pour un travail agentique sérieux, c'est ce que les équipes recherchent réellement — les tarifs mélangés varient d'environ 1 $ à 10 $ par million de tokens selon le niveau, le contexte et combien le cache vous fait économiser.

18 milliards de tokens à ces tarifs : 18 000 $ à 180 000 $ par mois. Appelez cela le métabolisme de 20K à 200K.

Voici la vérité inconfortable : presque aucun individu, et presque aucun département d'entreprise, n'approuve ce chiffre. Donc, personne ne fonctionne à ce métabolisme. Ils limitent leur cognition à ce que le budget permet, puis se demandent pourquoi leur production d'IA ressemble à celle des autres — parce que c'est le cas.Le niveau d'abonnement est une limite de vitesse sur votre pensée.

La vraie raison pour laquelle "l'IA n'a pas rendu tout le monde 10x productif" est plus simple que le discours ne l'admet : la productivité 10x est un phénomène de volume de tokens, et presque personne ne peut se permettre les tokens au détail.

La facture réelle

Mes dépenses réelles : environ 1 200 $ par mois.

Divisez-le. C'est environ sept cents par million de jetons, mélangé à tout — rédaction, codage, recherche, traduction, les essaims. Par rapport au scénario de détail le moins cher, la même cognition coûte 15 fois plus. Par rapport au scénario agentique réaliste — longs contextes, modèle de pointe, erreurs de cache — c'est 100 fois et plus.

Moins de 6 % du scénario Claude le moins cher. Moins de 1 % du pire.

Et non, je ne fais pas fonctionner des modèles moins performants partout. Les résultats que vous avez lus — les chapitres de livre, les rapports d'audit, ce post — ne sont pas de qualité à sept cents. Le truc n'est pas "modèle bon marché". Le truc est de payer des prix de pointe uniquement là où la qualité de pointe change réellement le résultat.

Louez les modèles, possédez tout le reste

Les économies ne sont pas un hack. Elles sont la conséquence de trois décisions de propriété prises tôt, par principe :

1. Possédez les données. Chaque fichier mémoire, note quotidienne, carte d'entité, transcription de session et journal de décision vit dans des fichiers sur des machines que je contrôle, dans des formats que je peux lire avec cat. Rien d'important ne se trouve dans la base de données d'un fournisseur où les frais de récupération s'accumulent indéfiniment. Le fournisseur détient les poids ; je détiens le contexte. Le contexte est l'actif qui s'apprécie.

2. Posséder la logique de flux de travail. Les invites, que l'agent exploite, les portes de qualité, les pipelines — code local, versionné, inspectable, refactorable. Quand un flux de travail produit de la valeur, la valeur atterrit dans mon dépôt, pas dans la bibliothèque de modèles de quelqu'un d'autre. Les fournisseurs peuvent me louer de l'intelligence. Ils ne peuvent pas me louer mon propre jugement, codé.

3. Posséder le choix du modèle. C'est celui qui cause des dommages économiques. Entre moi et chaque modèle se trouve mon moteur de routage — Mercury Flux. Chaque appel est classé par tâche et routé vers le modèle qui gagne en rapport qualité-prix pour cette classe, avec des chaînes de secours lorsque un fournisseur est en difficulté.

Le principe est 操盤人, pas consommateur : les opérateurs n'achètent pas de marques. Les opérateurs déploient des capacités.

Le Fossé de Routage

Tout le monde considère la facture d'IA comme Coût = Tokens × Prix, puis optimise les Tokens — invites plus courtes, moins d'appels, moins d'IA. Très bien. Mais c'est optimiser votre métabolisme vers le bas. Limiter la cognition pour économiser de l'argent est une stratégie de pauvreté.

L'autre terme est Prix — et le prix n'est pas une constante. C'est une fonction de routage.

Coût de la cognition = Tokens × Prix mélangé, où le prix mélangé = Σ (part des tokens par classe de tâche × meilleur prix pour cette classe).

Dans ma pile, la grande majorité des tokens — récupération, classification, résumé, traduction, génération de première ébauche — sont dirigés vers des modèles qui coûtent une fraction des tarifs de pointe. Le modèle de pointe gère le dernier kilomètre : la version finale d'un chapitre, la décision architecturale, le jugement orienté client. L'intelligence coûteuse est des forces spéciales, déployées au point de levier maximum — pas l'armée permanente occupant chaque rue. Aucun général n'envoie des forces spéciales patrouiller chaque bloc. Aucun opérateur ne devrait envoyer un modèle de pointe pour résumer une page web.

Le fossé de routage : celui qui contrôle la sélection des modèles contrôle le coût d'une sortie identique. La qualité du modèle est le fossé du fournisseur. La sélection est la vôtre.

Notez ce qui se passe lorsque les prix baissent — et ils le feront. L'écart entre le modèle de pointe et le modèle de milieu de gamme ne se ferme pas ; c'est un écart. Le routage capture l'écart dans n'importe quel régime de prix. Le modèle de pointe d'aujourd'hui devient le modèle de milieu de gamme de demain, et le routeur se réindexe automatiquement. Le fossé ne s'érode pas avec la déflation. Il se réindexe.

Pourquoi les essaims changent tout

L'effet de second ordre que personne ne prend en compte : la structure des coûts détermine la structure organisationnelle.

À des prix de détail, un conseil de 15 agents — un rédacteur, quatre critiques, un vérificateur de faits, un enforceur de style, révisant en parallèle — est une démonstration de conférence. Personne ne recrute des conseils pour chaque livrable à 10 $ par million de jetons. À sept cents en moyenne, un conseil est un poste budgétaire. Mon essaim vit sur un Mac Studio. Il bourdonne. Il ne me facture pas.

Une cognition bon marché rend la division du travail abordable. Vous arrêtez de construire "un chatbot" et commencez à construire un organigramme d'agents — rédacteurs, réviseurs, auditeurs, bibliothécaires — avec le routage comme département des ressources humaines. C'est le véritable mécanisme derrière le volume de production. Pas des invites de génie. Le personnel.

La version Entreprise

Si vous êtes un CAIO ou un CTO, effectuez le même audit sur votre organisation. Vos équipes brûlent des jetons quelque part ; la seule question est de savoir si cela passe par votre couche de routage ou par le bouton le plus proche.

Deux notes de ma vie de consultant :

  • Les flux de travail agentiques meurent à des prix de détail.Les flux de travail qui font réellement bouger les chiffres — audits GEO continus à travers ChatGPT, Perplexity et Gemini ; surveillance des citations ; suivi des entités ; qualification des leads toujours active à travers le fossé de transfert AI-humain — sont des fours à jetons par conception. À des prix de détail, ils naissent morts, et tout le monde conclut que "l'IA est chère." Routés, ce sont des tâches cron.

  • Le verrouillage des fournisseurs, c'est louer votre propre flux de travail.Chaque année sans une couche de routage, le chemin de mise à niveau est de payer plus, de bouger moins. Le SaaS a enseigné cette leçon aux entreprises une fois. L'IA l'enseigne à nouveau, avec des intérêts composés.

Arrêtez d'acheter de l'intelligence au détail. Commencez à la programmer comme du calcul — prix découvert par tâche, échangeable par appel, possédé à la couche qui compte.

Ce que vous faites lundi

  1. Mesurez votre métabolisme.Tirez des comptes de jetons réels à travers tous les outils pendant 30 jours. Vous ne pouvez pas gérer un nombre que vous n'avez jamais vu. La plupart des équipes se trompent de 10x dans un sens ou dans l'autre.

  2. Déplacez votre état vers des fichiers que vous possédez.Mémoire, décisions, logique de flux de travail — hors des silos de fournisseurs, dans votre dépôt. Un week-end de travail. Cela s'accumule pour toujours.

  3. Mettez un routeur entre vous et chaque modèle.Cela ne doit pas être Flux — construisez la version légère. Classification des tâches, cartographie des modèles, chaînes de secours, journalisation des coûts. Même un routeur rudimentaire réduit la facture de 5 à 10 fois dès le premier mois.

  4. Réinvestissez l'écart.Les économies ne sont pas l'objectif. L'objectif est ce qu'un métabolisme de 20K $ à un coût de 1,2K $ achète : le conseil, l'essaim, le volume, la vitesse. L'écart entre vous et tout le monde cesse d'être le talent et devient le débit.

La stratégie d'IA la plus coûteuse en 2026 n'est pas de choisir le mauvais modèle. C'est de payer des prix de frontière pour chaque jeton parce que vous n'avez jamais construit la couche qui choisit.

Louez les modèles. Possédez le routage. Gardez la différence — puis dépensez la différence pour plus de cognition.

Solution technologique Mercury : Accélérez la digitalité.