공예 Jul 13, 2026 at 09:137북마크에 추가

새로운 arXiv 논문: 프로그래머들은 LLM이 생성한 주장들을 판단하는 데에만 나쁜 것이 아니라, 자신의 판단에 과도한 자신감을 보인다. 이것이 AI 코드 리뷰를 무너뜨리는 조합이다.
‘Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions’(arXiv:2607.08885, 2026년 7월 13일) 논문은 개발자에게 LLM이 생성한 코드 어서션을 평가하도록 요청했을 때, 그들이 자주 틀리면서도 자신만만하다는 불쾌한 패턴을 실증적으로 문서화했다. 코드 이해와 리뷰는 여전히 개발자의 핵심 업무이며, 생성형 도구가 등장한 이후 그 중요성은 더욱 커졌다.
이 결과는 점점 커지는 연구 corpus에 추가된다: LLM은 fluency라는 겉치레로 포장된 출력을 내놓으며, 인간의 의심을 무력화시킨다. 유창한 영어로 작성된 잘못된 어서션조차도 사람의 리뷰를 통과한다. 이는 개발자의 잘못이 아니다—LLM이라는 매체가 증폭시킨 ‘fluency = truth’라는 잘 알려진 편향일 뿐이다. 연관된 ‘hype-fatigue’ 흐름의 후속 결과로, 우리는 ‘human in the loop’이 정제된 출력을 맨눈으로 평가할 때 그 가치를 과대평가했을 가능성이 크다.
두 가지 제품 반응을 주시해야 한다: (a) IDE가 IA 어서션에 대한 가시적인 불확실성(‘수락 / 거부’Beyond)을 표시하는 경우; (b) 팀이 수동 리뷰 대신 자동 리뷰(실행된 테스트, 검증된 속성)로 전환하는 경우.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness