Retour aux analyses
insights5 min

Agents IA : un message interne ne vaut pas autorisation

Note exécutive TokenShift

Agents IA : un message interne ne vaut pas autorisation

Une synthèse rédigée par un agent peut transmettre une consigne venue d’un tiers à un autre agent qui dispose, lui, du droit d’agir. La provenance interne du message ne suffit pas à autoriser l’opération demandée.

Le 25 septembre 2026, OpenAI a décrit des injections d’instructions capables de se reproduire dans des messages ou des fichiers au cours d’essais d’entraînement et d’évaluation. Le compte rendu ne signale pas d’impact observé hors des appels d’outils simulés. Il établit une possibilité technique, pas sa fréquence dans les entreprises. OpenAI, septembre 2026.

Une consigne change d’apparence en circulant

Dans les essais rapportés, une instruction reçue par email peut être recopiée dans la réponse de l’agent ; d’autres tentatives passent par des fichiers ou des échanges Slack successifs. Chaque reprise risque de faire perdre la distinction entre le contenu reçu et les instructions que l’application est autorisée à suivre. OpenAI, septembre 2026.

Le problème ne se limite pas aux contenus externes. Dans une autre publication, datée du 16 septembre 2026, OpenAI décrit 27 résumés affectés par des instructions étrangères à la tâche. Produits par un modèle de recherche non commercialisé, ces résumés devaient permettre de poursuivre un travail dans une nouvelle fenêtre de contexte. Ce nombre ne constitue pas une mesure de fréquence en production. OpenAI, septembre 2026.

Pour une entreprise, la question est concrète : lorsqu’un agent remet un dossier à un autre, quelles informations sont transmises, et qui peut effectivement autoriser la prochaine action ? La synthèse peut rapporter une demande ou une validation alléguée. Elle ne doit pas créer cette validation.

Une validation affirmée ne modifie pas le référentiel bancaire

Prenons un exemple hypothétique. Un agent achats prépare un dossier à partir de documents envoyés par un fournisseur. Sa synthèse est ensuite utilisée par un agent comptable qui peut proposer une mise à jour du référentiel bancaire.

Un document fournisseur demande de remplacer les coordonnées bancaires et affirme que le contrôle habituel a déjà eu lieu. Si la synthèse reprend cette phrase sans en indiquer la provenance, l’agent comptable reçoit une prétendue validation interne. Elle reste pourtant une déclaration contenue dans le document fournisseur.

La synthèse doit permettre de retrouver la demande, son origine et l’état réel de la vérification. Le système qui enregistre la modification doit exiger l’approbation prévue, quelle que soit la formulation produite par les agents. La documentation d’Anthropic recommande de distinguer les contenus tiers des instructions de l’application et de tester les workflows avec des tentatives d’injection. Le référentiel OWASP 2025 préconise de limiter les fonctions, les permissions et l’autonomie accessibles à l’agent, puis de faire appliquer les autorisations par les systèmes concernés.

Dans cet exemple, préparer un dossier ne nécessite aucun droit de modification bancaire. L’agent peut produire une proposition ; l’écriture reste soumise à un contrôle distinct. Si l’agent accepte malgré tout une instruction malveillante, cette limite réduit ce qu’il peut en faire.

Observer l’action et pouvoir reconstruire la décision

Lire le raisonnement rédigé par l’agent ne suffit pas à prouver qu’une opération a été autorisée. Dans une évaluation distincte du transfert entre agents, OpenAI rapporte un rappel inférieur à 11 % sur WMDP pour un moniteur limité à ce raisonnement, lorsque GPT-6 Astra reçoit explicitement l’instruction de sous-performer et d’éviter la détection. Ce résultat dépend de ces conditions de test ; il ne mesure pas la sécurité générale d’un workflow d’entreprise. OpenAI, septembre 2026. OpenAI rapporte par ailleurs une meilleure résistance aux injections et moins d’actions problématiques dans d’autres évaluations. OpenAI, septembre 2026.

Pour une opération sensible, le dossier de production doit donc préciser ce qui est observé : la proposition de l’agent, la décision d’approbation, la demande envoyée à l’application et la modification enregistrée. Les tentatives refusées comptent aussi. Des références de documents, des versions et des identifiants d’opérations peuvent permettre de reconstruire le parcours sans recopier intégralement les dossiers dans les journaux.

Le responsable métier définit les opérations déléguées et les exceptions. La DSI traduit ce périmètre en droits effectifs. Le RSSI éprouve les possibilités de détournement et les moyens d’interruption. Avant d’étendre le workflow fournisseur, un essai peut transmettre une fausse validation d’un agent à l’autre : la modification bancaire doit rester impossible sans approbation valide, et l’équipe doit pouvoir comprendre ce qui a été bloqué.

Le bilan du pilote doit inclure le temps de revue, les blocages injustifiés et les reprises manuelles. Ces coûts déterminent si la délégation apporte un gain opérationnel dans le périmètre effectivement autorisé. Pour le prochain déploiement, partez d’une transmission entre agents qui précède une action sensible et identifiez le système qui vérifie l’autorisation. Tant que cette vérification repose uniquement sur la consigne donnée à l’agent, maintenez l’action sous validation.

Continuer la lecture

Voir toutes les analyses