Après · rétrospective

Assistants de code : pourquoi deux études mesurent des effets opposés

Copilot accélère une tâche cadrée dans une expérience de 2022 ; une étude METR observe un ralentissement sur des dépôts familiers en 2025. Lire les contextes avant les pourcentages.

Repères éditoriaux

Publié le 30 septembre 2026

Base documentaire arrêtée au 30 septembre 2026 · Échéance examinée : 10 juillet 2025

Ces dates renseignent la lecture éditoriale, sans constituer une preuve indépendante d’antériorité.

Deux ensembles de notes techniques sur un bureau, photographie conceptuelle de contextes de travail distincts.

La question du dossier

Un assistant de code fait-il gagner du temps ? Une réponse qui ignore la tâche, l’expérience des personnes, la période et la qualité attendue risque de confondre des situations différentes. Nous lisons trois publications primaires : l’expérience de Peng et ses collègues sur GitHub Copilot, l’étude de Becker et ses collègues chez METR, puis la note de METR de février 2026 sur une tentative de suivi. Cette confrontation n’est pas une méta-analyse ; elle n’établit pas l’effet moyen actuel de tous les assistants.

La lecture en trente secondes

Observation expérimentale située. Dans une expérience menée en 2022 auprès de développeurs recrutés pour construire un serveur HTTP JavaScript, Peng et ses collègues rapportent un temps de réalisation inférieur de 55,8 % dans le groupe disposant de Copilot, parmi les participants ayant achevé la tâche. Chez METR, seize développeurs expérimentés travaillant sur leurs dépôts open source familiers ont réalisé 246 tâches entre février et juin 2025 ; l’accès aux outils d’IA s’accompagne d’un temps de réalisation supérieur de 19 % dans ce protocole.

Interprétation. Ces résultats ne s’annulent pas et ne s’additionnent pas. Ils mesurent des tâches, populations, outils et années différents. En février 2026, METR précise qu’une nouvelle collecte suggère possiblement une accélération, mais que sa sélection des participants et des tâches rend l’estimation peu fiable. Pour décider, il faut mesurer le cycle complet d’une tâche représentative, y compris vérification, intégration et reprise.

Trois dates, trois périmètres

  • Mai à juin 2022. Peng, Kalliamvakou, Cihon et Demirer recrutent 95 développeurs professionnels via Upwork et les répartissent aléatoirement entre accès à Copilot et contrôle. Le travail consiste à construire un serveur HTTP en JavaScript. Leur publication de février 2023 rapporte une réduction de 55,8 % du temps de réalisation pour le groupe assisté. L’étude porte sur cette tâche standardisée et sur les participants qui l’ont réalisée ; elle ne mesure pas toutes les étapes d’un projet logiciel.
  • Février à juin 2025. Becker, Rush, Barnes et Rein, chez METR, assignent aléatoirement 246 tâches à seize contributeurs expérimentés sur des projets qu’ils connaissent depuis plusieurs années. Leur publication du 10 juillet 2025 constate un temps supérieur de 19 % lorsque les outils d’IA sont autorisés, principalement Cursor Pro avec Claude 3.5 ou 3.7 Sonnet. Elle ne démontre pas un ralentissement de tous les développeurs ni des outils futurs.
  • 24 février 2026. Becker et ses collègues décrivent une nouvelle expérimentation dont les résultats bruts suggèrent un autre effet. METR juge toutefois son estimation actuelle peu fiable : certains développeurs et certaines tâches qui pourraient bénéficier fortement de l’IA sortent du protocole. Ce n’est pas une correction qui efface le résultat de 2025 ; c’est une limite explicite à sa généralisation dans le temps.

Lecture contradictoire

La lecture favorable à l’accélération

Position documentée. Peng et ses collègues ont observé un gain sur une tâche précisément définie. Pour une équipe qui doit produire un premier jet comparable, ce résultat motive un essai local. METR écrit en 2026 qu’une accélération avec les outils récents lui paraît plausible, tout en qualifiant ses nouvelles données de faibles pour en mesurer la taille. Il serait injustifié de rejeter ces résultats parce qu’une autre étude a trouvé un effet inverse dans un autre contexte.

La lecture attentive au coût de la reprise

Position documentée. L’étude METR de 2025 porte sur des contributeurs qui connaissent leurs dépôts et leurs standards de qualité. Un outil peut produire du code rapidement et demander ensuite du temps pour comprendre, vérifier et intégrer sa proposition. Le résultat expérimental rend cette possibilité visible, sans établir que cette explication particulière cause à elle seule les 19 % observés. Les auteurs examinent plusieurs caractéristiques possibles du protocole, sans lever toutes les incertitudes.

Ce que la contradiction change dans une décision

Notre interprétation. Le bon dénominateur est la tâche complète dans votre contexte, et le bon résultat comprend le travail livré et sa qualité. On ne peut transférer ni « 55,8 % plus vite » ni « 19 % plus lentement » tel quel à une autre équipe. Un essai utile compare des tâches prévues avant leur attribution, documente les outils et la période, puis note le temps de vérification, les retours et les corrections. Les personnes concernées doivent pouvoir expliquer ce que la mesure ne voit pas.

Nous présentons ici les positions publiques écrites des chercheurs, sans leur attribuer une réaction à ce dossier. Aucune demande de réponse individuelle n’a été envoyée dans le cadre de cette préparation. Les auteurs ou personnes concernées peuvent demander une rectification ou proposer une réponse argumentée via la page de contact éditorial ; toute mise à jour significative sera datée dans le registre des révisions.

Ce qui ferait évoluer notre lecture

Une comparaison préenregistrée sur des travaux proches de ceux de l’organisation, avec attribution claire des tâches et mesure de la qualité après intégration, aiderait à déterminer si le gain apparent persiste. Une répétition avec les outils et pratiques de 2026 serait plus pertinente pour une décision actuelle que la seule reprise des chiffres de 2022 ou 2025. Nous réexaminerons aussi les explications lorsque METR publiera un protocole corrigé et des résultats interprétables.

Ce qui reste inconnu

Nous ne connaissons pas l’effet d’un assistant particulier sur les équipes de nos lecteurs. Les trois documents n’isolent pas une valeur universelle de « productivité de l’IA ». Ils n’autorisent aucune conclusion générale sur les emplois, les compétences ou la sécurité du code. La qualité de livraison et le coût de maintenance exigent des mesures propres à chaque cas.

Sources et vérifications

Sources consultées le 30 septembre 2026. Lire les questions encore ouvertes et la méthode de mémoire des choix.

Tous les articlesDiscuter cette lecture