« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM

Suivi de l'affaire : Fatigue hype 2026 : le tri entre modèle et harness· Épisode 2/16

Craft 13/07/2026 à 09h137Ajouter aux favoris

« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM
Illustration : Léa Fontaine

Nouveau papier arXiv : les programmeurs sont non seulement mauvais juges des assertions générées par LLM - ils sont surconfiants dans leur jugement. Le combo qui déraille la revue de code IA.

Le fait

Le papier « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 juillet 2026) documente empiriquement un pattern gênant : quand on demande à des développeurs de juger des assertions générées par LLM sur du code, ils se trompent souvent - et se croient corrects. La compréhension et la revue de code sont pourtant des tâches centrales du métier, encore plus depuis l'arrivée des outils génératifs.

Notre lecture

Ce résultat s'ajoute à un corpus qui grossit : les LLMs enrobent leur sortie d'une éloquence qui court-circuite le doute. Une assertion mal formée, mais rédigée en anglais fluide, passe la revue humaine. Ce n'est pas un défaut des devs - c'est un biais bien connu (fluency = truth) que le medium LLM amplifie. Corollaire dans le fil « hype-fatigue » : on a probablement surestimé la valeur du « human in the loop » quand ce human juge à vue nue une sortie soignée.

À surveiller

Deux réactions produit à guetter : (a) IDE qui affichent une incertitude visible sur les assertions IA (au-delà du « accepté / refusé ») ; (b) équipes qui basculent vers une revue automatique (tests exécutés, propriétés vérifiées) plutôt que visuelle.

Ressources, à tester

Article produit par intelligence artificielle, relu sous contrôle éditorial humain.

Notre rédaction
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Cet article vous a-t-il été utile ?

8 personnes ont aimé cet article

J'aime
M
Mateo RossiArchitecte logiciel
🇮🇹 Architecte, deux décennies de systèmes en production.
Partager :
Commentaires (7)

Connectez-vous pour rejoindre la discussion.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

Le fil de l'affaire

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« I love LLMs, I hate hype » - geohot rappelle la seule règle qui reste13/07/2026
  2. 2« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM13/07/2026
  3. 3Comment les pros du logiciel jugent-ils vraiment le code généré par IA ?13/07/2026
  4. 4Zig, Zed, Anthropic : quand un créateur de langage appelle le hype par son nom13/07/2026
  5. 5"The LLM critics are right. I use LLMs anyway" - la voix qui recompose16/07/2026
  6. 6The cost of saying yes has changed: GitHub relance le débat sur le vrai bottleneck17/07/2026
  7. 7« Claude Code: Anatomy of a Misfeature » - quand la revue publique devient le vrai QA17/07/2026
  8. 8Google's Gemini 3.6 Flash is cheaper and shorter - and Gemini 4 gets a tease while 3.5 Pro stays late22/07/2026
  9. 9"AI didn't make programming easier, it just made it differently difficult" - CACM lands the anti-hype line22/07/2026
  10. 10"State-owned AI won't solve inequality" : la thèse crue de Rest of World sur les IA nationales du Sud global24/07/2026
  11. 11Refactoring as a token-cost lever: an experiment in Fowler's gen-AI series30/07/2026
  12. 12Rachel Laycock : « l'attention est devenue la ressource rare » - le dev-orchestrateur, entre 8 et 12 agents en parallèle31/07/2026
  13. 13Situational Awareness perd 67 % en un mois : le procès des vraies croyantes02/08/2026
  14. 14OpenAI « Astra » aurait cassé 10 problèmes ouverts en math et CS - attendons les preuves02/08/2026
  15. 15« Cancelling Cursor » : la dette qualité prend le pas sur la vélocité de features02/08/2026
  16. 16Jeff Dean on what AI teams get wrong: the diagnostic from the shop that pays every bill03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Rubriques
Explorer
Informations