"Poor and overconfident": developers are poor judges of LLM assertions

진행 중인 이슈 : Fatigue hype 2026 : le tri entre modèle et harness· 편 2/16

크래프트 Jul 13, 2026 at 09:137북마크에 추가

"Poor and overconfident": developers are poor judges of LLM assertions
삽화 : Léa Fontaine

New arXiv paper: programmers are not only bad judges of LLM-generated assertions - they are overconfident in their judgment. The combo that derails AI code review.

The fact

The paper « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, July 13, 2026) empirically documents a troubling pattern: when developers are asked to judge assertions generated by LLMs about code, they often make mistakes—and believe they are correct. Understanding and code review are yet central tasks of the profession, even more so since the arrival of generative tools.

Our reading

This result adds to a growing body of work: LLMs wrap their output in an eloquence that short-circuits doubt. A poorly formed assertion, but written in fluent English, passes human review. This is not a flaw of the developers—it is a well-known bias (fluency = truth) that the LLM medium amplifies. Corollary in the « hype-fatigue » thread: we have probably overestimated the value of the « human in the loop » when this human judges a polished output at face value.

To watch

Two product reactions to watch for: (a) IDEs that display visible uncertainty about AI assertions (beyond « accepted / rejected »); (b) teams that switch to automated review (executed tests, verified properties) rather than visual review.

Resources

인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.

편집팀
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
이 기사가 도움이 되었나요?

8 명이 이 기사를 좋아합니다

좋아요
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
공유:
댓글 (7)

토론에 참여하려면 로그인하세요.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

이슈 타임라인

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« I love LLMs, I hate hype » - geohot reminds the only rule that remains13/07/2026
  2. 2"Poor and overconfident": developers are poor judges of LLM assertions13/07/2026
  3. 3How do software professionals really judge the code generated by AI?13/07/2026
  4. 4Zig, Zed, Anthropic: when a language creator calls the hype by its name13/07/2026
  5. 5"LLM 비판자들은 옳아. 그래도 나는 LLMs를 사용해" - 재구성하는 목소리16/07/2026
  6. 6GitHub가 "예스"라고 말하는 비용이 변했습니다: GitHub가 진정한 병목 현상에 대한 논쟁을 재점화합니다17/07/2026
  7. 7« Claude Code: 해로운 기능의 해부 » - 공개 리뷰가 진정한 QA가 되는 순간17/07/2026
  8. 8Google의 Gemini 3.6 Flash는 더 저렴하고 짧아졌으며, Gemini 4는 teas를 받지만 3.5 Pro는 늦게 유지됩니다.22/07/2026
  9. 9AI가 프로그래밍을 더 쉽게 만들지 않았으며, 단지 다르게 어렵게 만들었을 뿐입니다 - CACM이 반하이프 라인을 제시합니다.22/07/2026
  10. 10국가 소유 AI가 불평등을 해결하지 못할 것이라는 레스트 오브 월드의 냉정한 thesis24/07/2026
  11. 11리팩토링을 토큰 비용 레버로: 파울러의 Gen-AI 시리즈 실험30/07/2026
  12. 12레이첼 레이콕 : “‘주의’가 희귀한 자원이 되었습니다” - 8~12명의 에이전트를 동시에 관리하는 개발 오케스트레이터31/07/2026
  13. 13상황 인식 능력 67% 감소: 진정한 신자들의 재판02/08/2026
  14. 14OpenAI « Astra »가 수학 및 CS 분야에서 해결되지 않은 10개 문제를 해결했다는 주장 - 증거를 기다려야 할 듯02/08/2026
  15. 15"Cancelling Cursor": 품질에 대한 부채가 기능의 속도를 앞지르다02/08/2026
  16. 16제프 딘이 말하는 AI 팀의 잘못된 점: 모든 비용을 지불하는 상점에서 진단을 내리며03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
토픽
탐색
정보