크래프트 Jul 13, 2026 at 09:137북마크에 추가

새로운 arXiv 논문: 프로그래머들은 LLM이 생성한 주장들을 판단하는 데에만 나쁜 것이 아니라, 자신의 판단에 과도한 자신감을 보인다. AI 코드 리뷰를 무너뜨리는 조합.
‘Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions’(arXiv:2607.08885, 2026년 7월 13일) 논문은 개발자에게 LLM이 생성한 코드 어서션을 평가하도록 요청했을 때, 개발자들이 자주 틀리면서도 자신만만하다는 불쾌한 패턴을 실증적으로 보여준다. 코드 이해와 리뷰는 개발자의 핵심 업무이며, 생성형 도구의 등장 이후 그 중요성이 더욱 커졌다.
이 결과는 점점 커져가는 연구 결과에 추가된다: LLM은 fluency(유창성)로 포장된 출력을 내놓으며, 이는 인간의 의심을 무력화시킨다. 유창한 영어로 작성된 잘못된 어서션조차도 인간의 리뷰를 통과한다. 이는 개발자의 결함이 아니라 fluency = truth라는 잘 알려진 편견을 LLM이 증폭시킨 결과다. ‘과장 피로(hype-fatigue)’의 연장선에서, ‘인간이 중간에서 검토한다’는 개념의 가치를 과대평가했을 가능성이 크다. 이 인간은 정제된 출력을 맨눈으로 평가하는 데 그친다.
다음 두 가지 제품 반응을 주시해야 한다: (a) IDE가 IA 어서션에 대한 가시적인 불확실성(‘수락/거부’ 외)을 표시하는 것; (b) 팀이 수동 리뷰(눈으로 검토) 대신 자동 리뷰(실행된 테스트, 검증된 속성)로 전환하는 것.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness