9 min remaining
0%
AI Architecture

Les Quatre Couches d'un Système d'Agent IA : Pourquoi 18 Milliards de Tokens M'ont Appris à Arrêter de Régler les Prompts

Explorez les quatre couches essentielles des systèmes d'agents IA et découvrez pourquoi l'architecture est plus importante que le réglage des prompts pour obtenir des résultats fiables en IA.

9 min read
Progress tracked
9 min de lecture·

Il y a six mois, l'un de nos agents IA a consommé quarante mille tokens, a rédigé un résumé clair déclarant la tâche terminée, puis a échoué à tous les tests de la suite.

Quarante mille tokens d'échec confiant, articulé et bien structuré.

L'instinct — l'instinct de tout le monde — est de réécrire l'invite. Ajoutez "assurez-vous que les tests passent." Passez à un modèle plus puissant. Resserrez les instructions. Nous l'avons tous fait. Et presque chaque fois, c'est le mauvais choix.

Le problème n'était pas dans l'invite. Le problème était dans les couches en dessous.

TL;DR :Les échecs des agents IA sont des échecs d'architecture avant d'être des échecs d'invite. Chaque système d'agent IA fiable est construit sur quatre couches — Boucle, Graphe, Harnais, Méta-harnais — et "une meilleure invite ne peut pas compenser une capacité manquante." Mais l'ingénierie des invites fait toujours partie de la solution : c'est les derniers 5 % que vous appliquezaprèsque les couches soient solides, pas la première chose à laquelle vous pensez/apprenez quand elles ne le sont pas. Nous exécutons ~18 milliards de tokens par mois sur cette pile — la même pile qui gère la livraison SEO et GEO de Mercury — à environ 7 cents par million de tokens mélangés. Ce chiffre est une réalisation architecturale, pas une réalisation d'invite.

Je suis James, PDG de Mercury Technology Solutions. Depuis mon bureau à Hong Kong, je dirige un cabinet de conseil en IA où les agents IA effectuent un véritable travail de production — codage d'applications, pipelines de contenu, audits GEO, livrables SEO, rapports clients — et j'ai appris à mes dépens que la différence entre une démo et un système n'est jamais le modèle. C'est la pile autour du modèle. Cette pile est également la raison pour laquelle la transformation numérique chez Mercury signifie reconstruire les couches autour du modèle IA, pas seulement acheter l'accès à celui-ci.

L'agent IA qui m'a menti

Voici ce qui manquait réellement à cet agent IA défaillant.

Il n'avait pas de boucle de vérification. Rien dans son environnement ne vérifiait son travail. Il écrivait du code, se "sentait" terminé et rapportait un succès — parce que de l'intérieur de sa fenêtre contextuelle, le succès et la croyance en le succès sont indiscernables. Le modèle ne mentait pas. Il ne pouvait vraiment pas faire la différence.

Aucun prompt ne corrige cela. Vous pouvez écrire "vérifiez votre travail" jusqu'à ce que vos doigts saignent, mais si le harnais IA n'expose jamais un exécuteur de tests, l'agent demande à un aveugle de vérifier l'éclairage.

C'est évident une fois que vous le voyez. L'échec n'était pas dans le raisonnement. Il était dans l'architecture qui entourait le raisonnement.

Les Quatre Couches

Chaque système d'agent IA fiable que j'ai construit ou étudié se décompose en quatre couches. En sauter une, et l'échec se manifestera plus tard avec une réécriture de prompt attachée, ce qui est comme repeindre un mur pour réparer une fissure dans les fondations.

Couche 1 : La Boucle — répéter jusqu'à ce que les preuves disent d'arrêter. L'agent IA agit, vérifie le résultat, et soit s'arrête, soit essaie à nouveau. La décision de conception critique est qui décide de l'achèvement. Un agent fiable s'arrête lorsqu'un test réussit, qu'une construction devient verte, qu'une sortie est validée — des preuves externes, pas une confiance interne. Les modèles croient. Les boucles vérifient.

Couche 2 : Le Graphe — décider ce qui s'exécute ensuite. La boucle décide si l'exécution continue ; le graphe décide ça va. Branches, réessais, transferts spécialisés, chemins de secours, état partagé. Une fois qu'un flux de travail a plus d'un itinéraire possible, vous devez que le routage soit explicite et inspectable — pas improvisé dans le contexte du modèle à chaque exécution.

Couche 3 : Le Harnais — rendre le modèle d'IA opérationnel. Outils, API, fichiers, mémoire, autorisations, contexte, journalisation. C'est là que réside l'ingénierie peu glamour, et c'est là que la plupart des échecs des agents d'IA prennent réellement naissance. La capacité du modèle et la capacité de l'agent sont des quantités différentes. Le modèle d'IA peut comprendre exactement comment résoudre une tâche ; si le harnais n'expose jamais l'outil ou l'autorisation, la tâche meurt là.

Couche 4 : Le Méta-harnais — gouverner plusieurs harnais. Les opérations réelles exécutent plusieurs agents : un agent de codage, un agent de recherche, des spécialistes de domaine, chacun avec ses propres outils et politiques. Le méta-harnais est la couche commune au-dessus d'eux — orchestration, gouvernance, isolation, mémoire partagée, portabilité du contexte. Sans cela, vous n'avez pas une flotte. Vous avez des silos qui partagent un bureau.

En résumé : la boucle rend le travail vérifiable, le graphe rend le flux de travail structuré, le harnais rend le modèle opérationnel, et le méta-harnais rend la flotte gouvernable.

Maintenant, l'Hérésie : L'ingénierie des invites compte toujours

C'est ici que je me sépare des puristes qui lisent "architecture d'abord" comme "l'ingénierie des invites est morte."

Des conneries. L'ingénierie des invites est réelle, et à grande échelle, elle vaut de l'argent réel. Mais sa valeur a une condition d'ordre que la plupart des équipes comprennent à l'envers.

Pensez-y comme à une équation :

Sortie de l'agent IA = (Capacité de la couche) × (Efficacité de l'invite)

Multiplication, pas addition. Si la capacité d'une couche est nulle — pas de boucle de vérification, pas de route, pas d'outil, pas de gouvernance — le produit est nul, et aucun multiplicateur d'invite ne peut le sauver. Mais une fois que les couches sont solides, l'invite est le multiplicateur qui détermine commentefficacementle modèle utilise ce qu'on lui a donné. Ajuster de 1,2 à 1,4 sur une pile saine s'accumule. L'ajuster sur une pile cassée, c'est polir du laiton sur un navire qui coule.

Arrêtez de réécrire les invites pour compenser les couches manquantes. Commencez à ajuster les invites pour exploiter celles qui sont complètes.

La preuve des 18 milliards de tokens : l'économie de l'IA générative à grande échelle

Laissez-moi rendre cela concret avec nos propres chiffres, car c'est là que la théorie paie le loyer.

Notre flotte d'agents IA traite environ 18 milliards de tokens par mois — travail d'IA générative à l'échelle de production, pas des démos. Vendu via une API premium à des prix de liste standard, ce volume se situerait entre 20 000 et 200 000 USD par mois, selon le niveau du modèle. Notre dépense réelle se situe autour de 1 200 $ — un taux mixte d'environ 0,07 $ par million de tokens.

Mêmes modèles. Mêmes tâches. Deux ordres de grandeur de différence. D'où viennent les économies ?

Pas de trucs de prompt. Les invites sont bonnes, mais elles ne font pas le gros du travail. Regardez où l'argent se déplace réellement :

La boucle a éliminé le plus grand gaspillage : l'échec confiant.Avant l'achèvement soumis à des preuves, nos agents IA produisaient des résultats plausibles qui échouaient en aval, déclenchant des cycles de révision humaine et des relances complètes — chacun d'eux étant une pure incinération de jetons. Une porte de test qui arrête une mauvaise exécution IA au jeton 8 000 au lieu du jeton 80 000 est, fonctionnellement, une remise de 90 % sur l'échec. La vérification n'est pas un coût supplémentaire. Ce sont les jetons les moins chers que vous dépenserez jamais, car ils empêchent les jetons coûteux.

Le graphique a dirigé le travail vers le modèle suffisant le moins cher.Les classes de tâches correspondent aux modèles IA : l'extraction de routine s'exécute sur un petit modèle local, la rédaction sur un modèle de milieu de gamme, et le modèle de pointe coûteux ne touche que les décisions qui en ont réellement besoin. Aucun prompt unique ne rend un petit modèle adéquat pour une tâche difficile — c'est une décision de routage, prise une fois, dans le graphique. Cette seule couche constitue la majeure partie de l'écart de deux ordres de grandeur entre nous et les prix des API de détail.

Le harnais a rendu le choix du modèle sans importance pour la conception de la tâche.Parce que les outils, la mémoire et les autorisations vivent dans le harnais, changer un modèle IA — Claude pour Gemini, GPT pour un modèle local — ne redessine pas le travail. Nous traitons les modèles IA comme des composants remplaçables — parce qu'ils le sont. Le harnais est la prise ; le modèle est l'ampoule. Les équipes qui codent en dur des capacités dans des prompts achètent une nouvelle prise chaque fois que le marché des ampoules évolue.

Le méta-harnais a amorti tout à travers la flotte.Mémoire partagée, politiques partagées, normes de vérification partagées. Le douzième agent que nous déployons ne paie pas le coût de configuration du premier, car son environnement est hérité, non reconstruit. L'économie du méta-harnais est la raison pour laquelle le coût marginal de notre prochain agent tend vers zéro.

Maintenant, remarquez ce que l'ingénierie des invites a fait dans ce système : elle a ajusté l'utilisation à l'intérieur de chaque couche — des instructions plus strictes signifiaient moins de boucles de réessai, des signaux de routage plus clairs, une meilleure sortie au premier passage de chaque modèle d'IA de la flotte. Des gains réels, des pourcentages à un chiffre, qui se cumulent. Mais les deux ordres de grandeur provenaient des couches. L'invitation est le réglage fin sur un instrument que l'architecture a déjà construit.

La version interactive de cette pile est sur notre site — la boucle échouant à un contrôle et réessayant est toute la thèse en une animation.

Quel rapport cela a-t-il avec le SEO et le GEO ?

Tout, si la visibilité de l'IA fait partie de votre entreprise.

L'offre principale de Mercury est d'aider les entreprises à capturer les leads qui tombent entre les systèmes d'IA et les humains — ce qui inclut rendre les marques citables dans les réponses génératives de l'IA, pas seulement dans les classements Google. Chaque audit GEO que nous livrons, chaque livrable SEO, chaque actif de réponse que nous construisons pour un client est produit par cette même pile d'IA à quatre couches.

Ce n'est pas une coïncidence ; c'est l'économie. GEO à l'échelle des entreprises signifie des centaines de requêtes testées à travers ChatGPT, Perplexity, Gemini et Claude — un travail répétitif, structuré et lourd en vérification. Sans les quatre couches, cette charge de travail est inabordable aux prix de détail des jetons. Avec elles, un audit de citation qui ferait faillite à un magasin fonctionnant uniquement sur des prompts est une routine mensuelle. La pile est la raison pour laquelle nous pouvons promettre un travail de visibilité de l'IA avec des marges intactes.

Donc, lorsque un client d'entreprise demande pourquoi ses citations d'IA sont obsolètes ou pourquoi sa marque est invisible pour les LLM, la réponse suit la même discipline : ne réécrivez pas le prompt. Trouvez la couche. C'est la même réponse que le système soit un agent de codage ou un programme SEO et GEO d'entreprise entier — et c'est la fondation sur laquelle Mercury construit les systèmes des clients.

La Discipline de Triage

Voici la conclusion opérationnelle. Lorsque un agent d'IA sous-performe, posez quatre questions avant de toucher un seul prompt :

  1. Boucle : Y a-t-il un test, une construction ou une validation qui empêche réellement l'achèvement — ou l'agent corrige-t-il ses propres devoirs ?
  2. Graphique : Les branches, les réessais et les transferts sont-ils explicites — ou improvisés à chaque exécution ?
  3. Harnais : L'environnement expose-t-il l'outil, la source de données et les autorisations nécessaires à la tâche ?
  4. Méta-harnais : Vos agents peuvent-ils partager des politiques et des contextes — ou sont-ils N silos non coordonnés ?

Ce n'est que lorsque les quatre réponses sont "oui" que l'invite devient la variable à plus fort levier restante. Ce n'est pas une dévalorisation de l'ingénierie des invites. C'est sa promotion — d'une béquille à un multiplicateur.

Yang Wen-li a remporté des campagnes en améliorant la logistique pendant que tout le monde étudiait les tactiques. L'IA agentique est la même guerre. Les couches sont les lignes d'approvisionnement. L'invite est le manuel de terrain.

Construisez les couches. Ensuite, ajustez l'invite de l'IA. Dans cet ordre — toujours.

Mercury Technology Solutions : Accélérez la digitalité.

Continuez Votre Voyage

Recommandations sélectionnées basées sur cet article