« L'IA te rend 55 % plus productif » : ce que les études disent

On nous le vend partout : l'IA rend les développeurs 55 % plus productifs. C'est le chiffre le plus répandu de l'industrie, et il est si lisse qu'on n'en a jamais vérifié l'origine. Sauf qu'il existe — dans une seule étude, dans un seul contexte. Tout le reste, c'est du marketing qui se croit de la science.
Le chiffre qui circule
« +55 % de productivité. » On le lit derrière une virgule, un point, un logo. Il a la texture d'un fait établi, comme « l'eau bout à 100 °C ». Il circule plus vite que le papier d'où il sort, parce qu'il est court, positif, et qu'il justifie un achat. C'est un chiffre qui se répand par contagion, pas par lecture.
Ce que dit l'étude d'origine
Le 55 % vient d'une étude Microsoft de 2023 (Peng et al., arXiv 2302.06590). 95 développeurs recrutés. La tâche : écrire un serveur HTTP en JavaScript, le plus vite possible. Le groupe avec Copilot a terminé 55,8 % plus vite (1 h 11 contre 2 h 41), p = 0,0017. C'est réel. C'est statistiquement significatif.
Sauf que c'est un examen. Une tâche unique, courte, connue, en langue familière, sans historique de base de code, sans revue, sans tests, sans dette. C'est la définition d'un benchmark : on mesure la vitesse sur un exercice que tout le monde sait faire, pas la vélocité sur un code que tu maintiens depuis trois ans.
La contre-étude
En 2025, METR a fait le test inverse. 16 développeurs expérimentés, leurs propres dépôts open source — des bases de plus d'un million de lignes de code. 246 tâches réelles : bugs, features, refactors, exactement le travail du quotidien. Tâches tirées au sort, avec ou sans outil d'IA (Cursor, Claude).
Résultat : les développeurs étaient 19 % plus lents avec l'IA. Et le plus révélateur — avant l'expérience ils prévoyaient un gain de 24 %, et après, ils étaient encore persuadés d'avoir gagné 20 %. Leurs jambes étaient plus lentes, leur tête leur disait le contraire. On appelle ça une illusion, et c'est précisément ce qui rend le chiffre « +55 % » si dangereux : il est aligné avec ce que les gens sentent, pas avec ce qu'ils font.
Le détail technique qui compte
Le 55 % et le −19 % ne se contredisent pas : ils mesurent deux mondes.
1. Le contexte de la tâche. Examen court et connu → l'IA accélère. Codebase dense et implicite → l'IA ralentit. METR pointe exactement ça : plus de code, plus de règles implicites (tests, docs, linting), plus la génération d'IA devient un coût à vérifier plutôt qu'un gain. 2. L'effort de vérification. Le temps « gagné » à générer se re-dépense à relire, corriger, et s'assurer que le code n'est pas presque bon. C'est la plainte n° 1 : le code « almost right », qui finit par coûter plus cher à réparer qu'à écrire. 3. L'échelle. DORA 2024 : pour chaque tranche de 25 % d'adoption en plus, la vélocité de livraison baisse de 1,5 % et la stabilité du système de 7,2 %. 75 % se sentent plus productifs ; les données disent le contraire. La perception et la mesure divergent, et c'est la perception qu'on vend.
My take
Le chiffre « +55 % » n'est pas faux, il est dénudé. Il a perdu son contexte (examen, tâche courte, langue familière, pas de dette) et il circule comme s'il s'appliquait à ton code, ta prod, ton lundi matin. C'est le genre de chiffre qui ne survit pas au contact d'une base de code réelle — et c'est exactement pourquoi il survit si bien dans une keynote.
Ce qui est honnête, c'est de dire : l'IA peut accélérer les tâches courtes et connues, elle ralentit les tâches complexes et implicites, et presque tout le monde se croit plus productif avec, peu importe ce que montre la mesure. Le reste, c'est de la pub.
Le titre que ça aurait dû être
« Une étude de 2023 montre +55 % sur un exercice unique de serveur HTTP ; en base réelle, une étude de 2025 mesure −19 % » — pas « l'IA te rend 55 % plus productif ».
Ce que tu peux vérifier de ton côté
- Mesurer ta vélocité avant et après sur tes propres tickets.
- Compter le temps de revue/correction du code généré, pas seulement la génération.
- Regarder tes métriques de stabilité (incidents, rollback) sur la période.
- Distinguer « je me sens plus rapide » de « la tâche a fini plus tôt ».
Vérifiable / non vérifiable
- Vérifiable : 55,8 % sur l'examen HTTP (Microsoft 2023), −19 % en prod réelle (METR 2025), 24 % prévu / 20 % perçu (METR), DORA 2024 (−1,5 % vélocité / −7,2 % stabilité par tranche de 25 % d'adoption).
- Non vérifiable : ton propre gain, qui dépend de ta base de code, de tes règles et de ta façon de mesurer.
Version 30 secondes
- « +55 % » = un examen court et connu, pas de la prod.
- En base réelle (1M+ lignes), les devs étaient 19 % plus lents — et se croyaient 20 % plus rapides.
- Le chiffre vit dans la perception, pas dans la mesure.
Sources
1. Peng et al. — « The Impact of AI on Developer Productivity: Evidence from GitHub Copilot » (arXiv 2302.06590, 2023) —