La question du dossier
Un assistant de code fait-il gagner du temps ? Une réponse qui ignore la tâche, l’expérience des personnes, la période et la qualité attendue risque de confondre des situations différentes. Nous lisons trois publications primaires : l’expérience de Peng et ses collègues sur GitHub Copilot, l’étude de Becker et ses collègues chez METR, puis la note de METR de février 2026 sur une tentative de suivi. Cette confrontation n’est pas une méta-analyse ; elle n’établit pas l’effet moyen actuel de tous les assistants.
La lecture en trente secondes
Observation expérimentale située. Dans une expérience menée en 2022 auprès de développeurs recrutés pour construire un serveur HTTP JavaScript, Peng et ses collègues rapportent un temps de réalisation inférieur de 55,8 % dans le groupe disposant de Copilot, parmi les participants ayant achevé la tâche. Chez METR, seize développeurs expérimentés travaillant sur leurs dépôts open source familiers ont réalisé 246 tâches entre février et juin 2025 ; l’accès aux outils d’IA s’accompagne d’un temps de réalisation supérieur de 19 % dans ce protocole.
Interprétation. Ces résultats ne s’annulent pas et ne s’additionnent pas. Ils mesurent des tâches, populations, outils et années différents. En février 2026, METR précise qu’une nouvelle collecte suggère possiblement une accélération, mais que sa sélection des participants et des tâches rend l’estimation peu fiable. Pour décider, il faut mesurer le cycle complet d’une tâche représentative, y compris vérification, intégration et reprise.
Trois dates, trois périmètres
- Mai à juin 2022. Peng, Kalliamvakou, Cihon et Demirer recrutent 95 développeurs professionnels via Upwork et les répartissent aléatoirement entre accès à Copilot et contrôle. Le travail consiste à construire un serveur HTTP en JavaScript. Leur publication de février 2023 rapporte une réduction de 55,8 % du temps de réalisation pour le groupe assisté. L’étude porte sur cette tâche standardisée et sur les participants qui l’ont réalisée ; elle ne mesure pas toutes les étapes d’un projet logiciel.
- Février à juin 2025. Becker, Rush, Barnes et Rein, chez METR, assignent aléatoirement 246 tâches à seize contributeurs expérimentés sur des projets qu’ils connaissent depuis plusieurs années. Leur publication du 10 juillet 2025 constate un temps supérieur de 19 % lorsque les outils d’IA sont autorisés, principalement Cursor Pro avec Claude 3.5 ou 3.7 Sonnet. Elle ne démontre pas un ralentissement de tous les développeurs ni des outils futurs.
- 24 février 2026. Becker et ses collègues décrivent une nouvelle expérimentation dont les résultats bruts suggèrent un autre effet. METR juge toutefois son estimation actuelle peu fiable : certains développeurs et certaines tâches qui pourraient bénéficier fortement de l’IA sortent du protocole. Ce n’est pas une correction qui efface le résultat de 2025 ; c’est une limite explicite à sa généralisation dans le temps.
Lecture contradictoire
La lecture favorable à l’accélération
Position documentée. Peng et ses collègues ont observé un gain sur une tâche précisément définie. Pour une équipe qui doit produire un premier jet comparable, ce résultat motive un essai local. METR écrit en 2026 qu’une accélération avec les outils récents lui paraît plausible, tout en qualifiant ses nouvelles données de faibles pour en mesurer la taille. Il serait injustifié de rejeter ces résultats parce qu’une autre étude a trouvé un effet inverse dans un autre contexte.
La lecture attentive au coût de la reprise
Position documentée. L’étude METR de 2025 porte sur des contributeurs qui connaissent leurs dépôts et leurs standards de qualité. Un outil peut produire du code rapidement et demander ensuite du temps pour comprendre, vérifier et intégrer sa proposition. Le résultat expérimental rend cette possibilité visible, sans établir que cette explication particulière cause à elle seule les 19 % observés. Les auteurs examinent plusieurs caractéristiques possibles du protocole, sans lever toutes les incertitudes.
Ce que la contradiction change dans une décision
Notre interprétation. Le bon dénominateur est la tâche complète dans votre contexte, et le bon résultat comprend le travail livré et sa qualité. On ne peut transférer ni « 55,8 % plus vite » ni « 19 % plus lentement » tel quel à une autre équipe. Un essai utile compare des tâches prévues avant leur attribution, documente les outils et la période, puis note le temps de vérification, les retours et les corrections. Les personnes concernées doivent pouvoir expliquer ce que la mesure ne voit pas.
Nous présentons ici les positions publiques écrites des chercheurs, sans leur attribuer une réaction à ce dossier. Aucune demande de réponse individuelle n’a été envoyée dans le cadre de cette préparation. Les auteurs ou personnes concernées peuvent demander une rectification ou proposer une réponse argumentée via la page de contact éditorial ; toute mise à jour significative sera datée dans le registre des révisions.
Ce qui ferait évoluer notre lecture
Une comparaison préenregistrée sur des travaux proches de ceux de l’organisation, avec attribution claire des tâches et mesure de la qualité après intégration, aiderait à déterminer si le gain apparent persiste. Une répétition avec les outils et pratiques de 2026 serait plus pertinente pour une décision actuelle que la seule reprise des chiffres de 2022 ou 2025. Nous réexaminerons aussi les explications lorsque METR publiera un protocole corrigé et des résultats interprétables.
Ce qui reste inconnu
Nous ne connaissons pas l’effet d’un assistant particulier sur les équipes de nos lecteurs. Les trois documents n’isolent pas une valeur universelle de « productivité de l’IA ». Ils n’autorisent aucune conclusion générale sur les emplois, les compétences ou la sécurité du code. La qualité de livraison et le coût de maintenance exigent des mesures propres à chaque cas.
Sources et vérifications
- Sida Peng, Eirini Kalliamvakou, Peter Cihon et Mert Demirer, *The Impact of AI on Developer Productivity*, février 2023 : expérience contrôlée menée en 2022 sur la réalisation d’un serveur HTTP JavaScript ; étude liée à GitHub et Microsoft, avec ce contexte d’intérêts à garder en vue.
- Joel Becker, Nate Rush, Beth Barnes et David Rein, METR, *Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity*, juillet 2025 : protocole randomisé, seize développeurs, 246 tâches et limites exposées par les auteurs.
- Joel Becker et collègues, METR, *We are Changing our Developer Productivity Experiment Design*, 24 février 2026 : limites de sélection et de mesure de leur tentative de suivi ; ne constitue pas un nouveau chiffre robuste sur l’effet actuel.
Sources consultées le 30 septembre 2026. Lire les questions encore ouvertes et la méthode de mémoire des choix.
