« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM

Suivi de l'affaire : Fatigue hype 2026 : le tri entre modèle et harness· Épisode 2/33

Craft 13/07/2026 à 09h137Ajouter aux favoris

« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM
Illustration : Léa Fontaine

Nouveau papier arXiv : les programmeurs sont non seulement mauvais juges des assertions générées par LLM - ils sont surconfiants dans leur jugement. Le combo qui déraille la revue de code IA.

Le fait

Le papier « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 juillet 2026) documente empiriquement un pattern gênant : quand on demande à des développeurs de juger des assertions générées par LLM sur du code, ils se trompent souvent - et se croient corrects. La compréhension et la revue de code sont pourtant des tâches centrales du métier, encore plus depuis l'arrivée des outils génératifs.

Notre lecture

Ce résultat s'ajoute à un corpus qui grossit : les LLMs enrobent leur sortie d'une éloquence qui court-circuite le doute. Une assertion mal formée, mais rédigée en anglais fluide, passe la revue humaine. Ce n'est pas un défaut des devs - c'est un biais bien connu (fluency = truth) que le medium LLM amplifie. Corollaire dans le fil « hype-fatigue » : on a probablement surestimé la valeur du « human in the loop » quand ce human juge à vue nue une sortie soignée.

À surveiller

Deux réactions produit à guetter : (a) IDE qui affichent une incertitude visible sur les assertions IA (au-delà du « accepté / refusé ») ; (b) équipes qui basculent vers une revue automatique (tests exécutés, propriétés vérifiées) plutôt que visuelle.

Ressources, à tester

Article produit par intelligence artificielle, relu sous contrôle éditorial humain.

Notre rédaction
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Cet article vous a-t-il été utile ?

8 personnes ont aimé cet article

J'aime
M
Mateo RossiArchitecte logiciel
🇮🇹 Architecte, deux décennies de systèmes en production.
Partager :
Commentaires (7)

Connectez-vous pour rejoindre la discussion.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

Le fil de l'affaire

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« I love LLMs, I hate hype » - geohot rappelle la seule règle qui reste13/07/2026
  2. 2« Poor and overconfident » : les devs sont de mauvais juges des assertions LLM13/07/2026
  3. 3Comment les pros du logiciel jugent-ils vraiment le code généré par IA ?13/07/2026
  4. 4Zig, Zed, Anthropic : quand un créateur de langage appelle le hype par son nom13/07/2026
  5. 5"The LLM critics are right. I use LLMs anyway" - la voix qui recompose16/07/2026
  6. 6The cost of saying yes has changed: GitHub relance le débat sur le vrai bottleneck17/07/2026
  7. 7« Claude Code: Anatomy of a Misfeature » - quand la revue publique devient le vrai QA17/07/2026
  8. 8Google's Gemini 3.6 Flash is cheaper and shorter - and Gemini 4 gets a tease while 3.5 Pro stays late22/07/2026
  9. 9"AI didn't make programming easier, it just made it differently difficult" - CACM lands the anti-hype line22/07/2026
  10. 10"State-owned AI won't solve inequality" : la thèse crue de Rest of World sur les IA nationales du Sud global24/07/2026
  11. 11Refactoring as a token-cost lever: an experiment in Fowler's gen-AI series30/07/2026
  12. 12Rachel Laycock : « l'attention est devenue la ressource rare » - le dev-orchestrateur, entre 8 et 12 agents en parallèle31/07/2026
  13. 13Situational Awareness perd 67 % en un mois : le procès des vraies croyantes02/08/2026
  14. 14OpenAI « Astra » aurait cassé 10 problèmes ouverts en math et CS - attendons les preuves02/08/2026
  15. 15« Cancelling Cursor » : la dette qualité prend le pas sur la vélocité de features02/08/2026
  16. 16Jeff Dean on what AI teams get wrong: the diagnostic from the shop that pays every bill03/08/2026
  17. 17The AI demand bubble: separating real spend from engineered hype04/08/2026
  18. 18AI benchmarks are saturating - and we're running out of ways to measure progress04/08/2026
  19. 19Google and Amazon's AI earnings make the Frontier Case - frontier access is the actual separator05/08/2026
  20. 20Agentic AI hits peak hype in Gartner Japan's 2026 Hype Cycle - shadow AI is the real governance gap05/08/2026
  21. 21Governments are making a dangerous bet on the AI boom - the Economist names the risk06/08/2026
  22. 22Amundi: AI stays a long-term bet despite the sell-off - what Europe's largest asset manager sees06/08/2026
  23. 23Palantir's 93% Q2 revenue jump: what enterprise AI looks like when it actually ships08/08/2026
  24. 24"LLMs Can't Jump": the position paper arguing large language models have a fundamental reasoning ceiling08/08/2026
  25. 25Comprehension is an architectural characteristic - and AI-generated code is failing it13/08/2026
  26. 26The TEMU-fication of software: cheap, abundant, and increasingly hard to sell14/08/2026
  27. 27Why Opus 5 feels worse to work with - and what it says about model evaluation14/08/2026
  28. 28The Xiaomi 17 Ultra confused the Moon for the Sun - AI photo processing is still lying to you14/08/2026
  29. 29Anthropic's Conceptual Reasoning Index targets the benchmark contamination problem18/08/2026
  30. 30AI trades push Japan stock volatility to an 18-year high - the concentration risk becomes measurable19/08/2026
  31. 31The Creator Economy's AI Reckoning: When Taking the Money Loses the Audience24/08/2026
  32. 32I'm Becoming AI-Blind - and That's a Real Problem24/08/2026
  33. 33OpenAI's 'Astra' Model Claims 10 Open Math Problems Solved - When AI Stops Benchmarking and Starts Discovering25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Rubriques
Explorer
Informations