Retour aux analyses
Gouvernance IA9 min

Votre modèle d'IA n'est pas votre système de production

Note exécutive TokenShift

Votre modèle d'IA n'est pas votre système de production

Quand un pilote d'IA cale, le réflexe est toujours le même : le modèle n'est pas assez bon. On attend la version suivante, on rouvre les comparatifs, on relance une consultation fournisseurs.

C'est presque toujours la mauvaise dépense.

Le 11 février 2026, OpenAI a publié un retour d'expérience interne qui déplace le problème. Trois ingénieurs, cinq mois, environ 1 500 demandes d'intégration, à peu près un million de lignes de code, et aucune ligne écrite à la main : tout produit par des agents. Le chiffre spectaculaire n'est pas le point intéressant. Le point intéressant est ce que l'équipe dit avoir fait chaque fois que ça échouait. Jamais « demandons mieux ». Toujours : quelle capacité manque, et comment la rendre lisible et opposable à l'agent ? Ils ont donné un nom à l'objet qu'ils construisaient sans l'avoir prévu : le harnais.

Le déplacement que 2026 a rendu visible

Trois années, trois disciplines successives. 2024 fut l'art du prompt : bien demander. 2025 fut l'art du contexte : bien nourrir. 2026 est l'art du système d'exécution : bien encadrer.

En mars 2026, LangChain a formulé l'équation qui circule depuis dans les équipes techniques : un agent, c'est un modèle plus un harnais. Le harnais, c'est tout ce qui n'est pas le modèle : l'état conservé entre deux étapes, l'exécution des outils, les boucles de retour, les contraintes réellement opposables. Un modèle brut n'est pas un agent ; il le devient quand un harnais lui donne de la mémoire, des outils, une vérification et des limites.

L'image se tient bien en comité : le modèle est le moteur, le harnais est la voiture. Un moteur de course monté sur un châssis sans freins ni direction ne produit pas une voiture rapide. Il produit un accident rapide.

La preuve, et sa limite, énoncées ensemble

L'affirmation serait creuse sans mesure. Une étude publiée sur arXiv en avril 2026 (Agentic Harness Engineering, référence 2604.25850) a fait l'expérience propre : garder le modèle inchangé et ne faire évoluer que le harnais, c'est-à-dire les outils, les couches intermédiaires et la mémoire. Sur le banc d'essai Terminal-Bench 2, le taux de réussite passe de 69,7 % à 77,0 % en dix itérations, et dépasse au passage le harnais conçu par des humains qui servait de référence, à 71,9 %.

Disons tout de suite ce que ce chiffre ne dit pas. Il porte sur des agents de code, sur un banc d'essai précis, et les auteurs bornent eux-mêmes la portée du transfert aux domaines et familles de modèles testés. Nous ne le transposons pas à votre back-office, et personne ne devrait le faire.

Ce qu'il établit est plus modeste et plus utile : à modèle constant, l'ingénierie du système autour déplace le résultat de plusieurs points. Cela ne prouve pas un gain chez vous. Cela suffit largement à changer un ordre de priorité budgétaire, parce que la dépense en question n'est pas la même. Changer de modèle est un achat. Construire un harnais est une compétence qui reste dans la maison, et qui survit au modèle suivant.

Les quatre bornes

L'article précédent de cette série posait la question de la responsabilité : qui spécifie, qui vérifie, qui approuve. Celui-ci pose la question complémentaire, celle du système : qu'est-ce que l'exécution autorise ? Quatre bornes, et une exigence commune à toutes.

1. Ce que l'agent peut voir. Quelles données, quels systèmes, sous quelle identité. Pas « il a accès au CRM », mais quel périmètre, avec quel filtre, journalisé où.

2. Ce qu'il peut faire. La liste des actions, séparée entre celles qui se défont et celles qui ne se défont pas. Envoyer un message, modifier un dossier, engager un paiement ne sont pas la même classe de risque et ne devraient pas partager le même régime d'autorisation.

3. Comment son travail est vérifié. C'est la borne la plus mal traitée, et Thoughtworks en donne la bonne grammaire dans ses travaux d'avril 2026 : les guides orientent l'agent avant qu'il agisse ; les capteurs observent le résultat après coup et lui permettent de se corriger. Chacun peut être déterministe, un test ou une règle qui passe ou ne passe pas, ou inférentiel, un autre modèle qui porte un jugement. Notre position est ferme : sur tout ce qui engage l'entreprise vis-à-vis d'un client, d'un régulateur ou d'un tiers, il faut au moins un contrôle déterministe. Un jugement inférentiel est une opinion rapide, ce n'est pas une preuve.

4. Qui répond quand ça dérape. Un seuil, un nom, un droit d'arrêt utilisable par quelqu'un qui n'a pas construit le système.

L'exigence commune est la seule chose qui compte vraiment : chaque borne doit être exécutable. Vérifiable par une machine, ou opposable par un journal. Une borne qui vit dans une note d'intention n'est pas une borne, c'est une déclaration d'intention avec un numéro de paragraphe.

Ce que cela change pour un comité exécutif

Deloitte, dans son édition Tech Trends 2026, donne la photographie : 11 % des organisations ont des agents en production, alors que 38 % en sont au stade du pilote, et que 35 % n'ont aucune stratégie agentique. Ce n'est pas un taux d'échec, et il faut résister à la tentation de le lire ainsi : c'est une distribution de maturité, et elle dit surtout où se tient presque tout le monde, c'est-à-dire sur la marche entre le pilote et la production. Le même travail relève par ailleurs que 21 % seulement des dirigeants interrogés déclarent un modèle de gouvernance mature pour l'IA agentique, sur une base de 3 235 responsables informatiques et métier dans 24 pays.

L'écart entre 38 et 11, c'est très exactement le harnais.

Un mardi de septembre, deux directions des risques d'un même groupe bancaire lancent un agent d'instruction de dossiers, sur le même modèle, avec le même fournisseur. La première a ouvert un accès large « pour ne pas brider les tests », et vérifie par échantillonnage en fin de mois. La seconde a écrit les quatre bornes avant la première requête : périmètre de données restreint aux dossiers du portefeuille, action d'engagement financier interdite, contrôle déterministe sur chaque montant et chaque référence client, escalade nommée au-delà d'un seuil. Six semaines plus tard, la première a un incident à qualifier et un dossier à reconstituer. La seconde a une mesure d'erreur, donc une décision d'extension à prendre. Même modèle. Deux systèmes d'exécution.

Vous ne choisissez pas un modèle, vous construisez un système d'exécution. Le modèle change tous les trimestres ; le harnais, lui, vous appartient.

Quatre questions pour votre prochain COMEX

  1. Pour notre agent le plus avancé, la liste de ce qu'il peut voir et de ce qu'il peut faire existe-t-elle ailleurs que dans la tête de celui qui l'a configuré ?
  2. Parmi ses actions, lesquelles sont irréversibles, et suivent-elles un régime d'autorisation distinct ?
  3. Quelle part de nos vérifications est déterministe, et quelle part repose sur le jugement d'un autre modèle ?
  4. Qui peut l'arrêter sans demander l'autorisation à l'équipe qui l'a construit ?

Si les quatre réponses tiennent dans une note et non dans une configuration, vous n'avez pas encore de système de production. Vous avez un pilote avec de bons résultats.

Le chantier de 2026 n'est pas d'acheter un meilleur modèle. Ils arriveront de toute façon, plus vite que vos cycles budgétaires, et votre avantage ne durera pas plus longtemps que celui de votre concurrent chez le même fournisseur. Le chantier est de construire, autour de ces modèles, un système d'exécution assez borné pour être confié à des agents et assez tracé pour être défendu devant un conseil. C'est ce que nous faisons passer du pilote à la production gouvernée chez nos clients, et ce que nous appliquons à nos propres produits, à commencer par RegRadar by TokenShift.

Question franche : dans votre organisation, la fiabilité de vos agents est-elle une propriété du modèle que vous avez acheté, ou du système que vous avez construit ?

Cette série se poursuit jusqu'à notre campagne COMEX de septembre. Suivez la Page pour la suite.

Sources :

  • OpenAI, Harness engineering: leveraging Codex in an agent-first world, 11 février 2026.
  • LangChain, The Anatomy of an Agent Harness, mars 2026.
  • Thoughtworks, Harness engineering and agent feedback: exploring AI coding sensors, et Technology Radar volume 34, avril 2026.
  • Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses, arXiv 2604.25850, avril 2026.
  • Deloitte, Tech Trends 2026, et enquête agentique associée (3 235 responsables informatiques et métier, 24 pays).

#GouvernanceIA #IAEntreprise #COMEX #MiseEnProduction

Continuer la lecture

Voir toutes les analyses