Retour aux analyses
insights9 min

L'écart de perception : vos équipes se sentent 20 % plus rapides, la mesure dit 19 % plus lentes

Note exécutive TokenShift

L'écart de perception : vos équipes se sentent 20 % plus rapides, la mesure dit 19 % plus lentes

Vos équipes vous disent que l'IA leur fait gagner du temps, et elles le croient sincèrement. Trois travaux publiés entre juillet 2025 et 2026, sur trois populations sans lien entre elles, montrent que cette conviction se trompe régulièrement, et toujours dans le même sens : à la hausse. Pour un COMEX qui arbitre ses budgets IA à partir des remontées de ses équipes, c'est d'abord un problème d'instrument de mesure.

L'écart de perception, mesuré trois fois

METR, juillet 2025. Seize développeurs open source expérimentés, 246 tâches réelles sur leurs propres dépôts, et un tirage au sort tâche par tâche pour autoriser ou interdire l'IA. Avant l'expérience, les participants anticipaient un gain de 24 % sur leurs délais. La mesure donne 19 % de temps en plus. Et après avoir vécu ce ralentissement, ils estimaient encore avoir gagné 20 %. Entre le gain ressenti et la perte mesurée, l'écart est de l'ordre de 39 points. METR borne elle-même la portée du résultat : un instantané des capacités du début 2025, dans un seul domaine.

Dell'Acqua et al., Organization Science, 2026. 758 consultants du BCG, 18 tâches réalistes. À l'intérieur du périmètre où le modèle est bon, les gains sont réels : 12,2 % de tâches en plus, 25,1 % plus vite, une qualité supérieure. À l'extérieur, sur une tâche managériale complexe choisie exprès, les utilisateurs de l'IA avaient 19 % de chances en moins de produire la bonne réponse. Les auteurs appellent cela la frontière dentelée : deux tâches d'apparence identique tombent de part et d'autre, et rien dans l'interface ne signale de quel côté on se trouve.

DORA 2025, Google Cloud. Près de 5 000 professionnels interrogés. 90 % utilisent l'IA au travail, plus de 80 % estiment qu'elle a augmenté leur productivité, et 30 % déclarent peu ou pas de confiance dans le code qu'elle produit. Le rapport maintient par ailleurs une relation négative entre adoption de l'IA et stabilité des livraisons : l'IA accélère la production, et cette accélération expose les faiblesses situées en aval.

Pourquoi la perception se trompe dans un seul sens

Le gain est visible, immédiat, concentré : la page se remplit, le brouillon existe, la sensation de vitesse est physique. Le coût est diffus et différé : relecture, correction, reprise trois semaines plus tard, incident en production. Chacun juge honnêtement l'étape qu'il exécute ; personne ne juge la chaîne. C'est là que se loge l'écart de perception. Et c'est pour cela qu'il ne se corrige pas seul avec l'expérience : les développeurs de METR ne l'avaient toujours pas corrigé après 246 tâches.

Un scénario, volontairement banal

Prenons une cellule réclamations de vingt personnes chez un assureur. Un assistant rédige les réponses clients. Les gestionnaires rapportent un gain de 30 %, la direction généralise. Six mois plus tard, le délai moyen de traitement n'a pas bougé. En instrumentant la chaîne complète, on trouve trois choses : la rédaction est effectivement plus rapide ; la relecture a doublé, parce que le texte est plausible même quand il est faux ; et le taux de réouverture de dossier à 30 jours a monté de quelques points. Le gain existe, il est réel, et il a été absorbé par une étape que personne n'avait mesurée.

Un protocole de mesure que le COMEX peut commander

Six semaines suffisent pour sortir du déclaratif. La démarche est empruntée à METR, et elle est reproductible en entreprise.

  1. Choisir une tâche, pas un cas d'usage. Une unité bornée, répétable, avec un début et une fin identifiables : un dossier, un ticket, une réponse client. Un cas d'usage ne se chronomètre pas.
  2. Randomiser tâche par tâche, jamais équipe contre équipe. Chaque dossier entrant est tiré au sort, « avec IA » ou « sans IA », sur la même population. Comparer deux équipes revient à mesurer la différence entre deux équipes.
  3. Mesurer trois grandeurs, pas une. Le délai de bout en bout, le taux de reprise en aval à 30 jours, et le temps de vérification humaine. Un dispositif qui ne mesure que la première produira toujours un gain.
  4. Recueillir la perception séparément, avant et après. Demandez aux opérateurs leur estimation de gain. L'écart entre cette estimation et la mesure est lui-même un indicateur de gouvernance : plus il est grand, moins vos remontées terrain sont exploitables pour arbitrer.
  5. Décider à date fixe. Industrialiser, redessiner le workflow, ou arrêter, avec un responsable nommé et une date. Un pilote sans date de décision devient une situation permanente.

Marqueurs à suivre ensuite, en continu : délai médian de bout en bout par dossier ; ratio temps de production sur temps de vérification ; taux de reprise à 30 jours ; écart perception-mesure en points, revu chaque trimestre ; part des sorties acceptées sans modification puis corrigées plus tard.

Erreurs à éviter

  • Prendre la satisfaction pour de la productivité. Un taux d'adoption élevé et un ressenti positif sont parfaitement compatibles avec une perte nette ; DORA l'observe à 90 % d'adoption.
  • Mesurer l'étape au lieu de la chaîne. C'est l'erreur qui fabrique les gains fantômes, celle du scénario ci-dessus.
  • Comparer une équipe équipée à une équipe témoin. Le biais de sélection avale l'effet que vous cherchez à mesurer.
  • Faire vérifier l'IA par le même modèle. L'auto-évaluation d'un modèle sur sa propre production n'est pas un contrôle. Si vous industrialisez une évaluation automatique, confiez-la à un modèle d'une autre famille et calibrez-la sur un échantillon annoté par des humains.
  • Changer de modèle pour régler un problème de flux. Quand la contrainte réelle est le nombre d'applications entre lesquelles l'opérateur recopie à la main, aucun modèle ne la lèvera.
  • Laisser le volume dépasser le contrôle. DORA est explicite : sans tests automatisés, gestion de versions mature et boucles de retour rapides, l'augmentation du volume produit de l'instabilité.

Ce que le calendrier réglementaire change à l'affaire

Depuis le 2 août 2026, le règlement IA est généralement applicable et les obligations de transparence de l'article 50 sont en vigueur : informer les personnes qu'elles interagissent avec un système d'IA, marquer les contenus générés. Le marquage lisible par machine prévu à l'article 50(2) bénéficie d'un délai courant jusqu'au 2 décembre 2026 pour les systèmes déjà sur le marché.

Le règlement (UE) 2026/1744, publié au Journal officiel le 24 juillet 2026, a en revanche reporté le régime haut risque : 2 décembre 2027 pour les systèmes autonomes de l'annexe III, 2 août 2028 pour l'IA embarquée dans les produits de l'annexe I. Il a également assoupli l'article 4 : fournisseurs et déployeurs doivent désormais soutenir le développement de la maîtrise de l'IA, et non plus en garantir un niveau suffisant.

Seize mois de plus ne sont pas seize mois de répit. Un dossier de conformité haut risque réclame des données de performance, des taux d'erreur documentés et une trace de la supervision humaine, exactement ce que le protocole ci-dessus produit. Les organisations qui commencent à mesurer maintenant arriveront en décembre 2027 avec un historique ; les autres arriveront avec un questionnaire.

Trois décisions pour ce trimestre

Choisissez un processus déjà outillé en IA et lancez la mesure randomisée dessus, avec un responsable nommé au COMEX et une date de décision inscrite au calendrier. Ajoutez le ratio temps de production sur temps de vérification à votre tableau de bord, à côté du taux d'adoption. Enfin, posez une règle simple : aucune généralisation d'un usage IA sans mesure de bout en bout, quel que soit l'enthousiasme des utilisateurs. L'enthousiasme n'est pas un indicateur, c'est précisément ce que ces trois travaux démontrent.

TokenShift accompagne les directions générales européennes sur le passage de l'IA du pilote à la production gouvernée : protocoles de mesure, ownership et conformité AI Act.

Sources

  • METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, 10 juillet 2025 : metr.org et arXiv:2507.09089
  • Dell'Acqua, McFowland, Mollick et al., Navigating the Jagged Technological Frontier, Organization Science, 2026 : doi.org/10.1287/orsc.2025.21838
  • Google Cloud et DORA, 2025 State of AI-assisted Software Development Report, septembre 2025 : dora.dev
  • Règlement (UE) 2026/1744 (« Digital Omnibus on AI »), publié au JOUE le 24 juillet 2026 ; synthèse du calendrier : Future of Privacy Forum

Continuer la lecture

Voir toutes les analyses