クラフト Jul 13, 2026 at 09:137ブックマークに追加

新しいarXiv論文:プログラマーはLLMが生成したアサーションを判断するのが下手なだけでなく、自分の判断に過剰な自信を持っている。これがAIによるコードレビューを破綻させる要因となる。
論文「Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions」(arXiv:2607.08885、2026年7月13日)は、開発者にLLMが生成したコードのアサーションを判断させた場合、しばしば間違えるにもかかわらず自信過剰であるという厄介なパターンを実証的に示している。コードの理解とレビューは、生成系ツールの登場以降ますます重要なタスクとなっている。
この結果は拡大する研究の一つに過ぎない:LLMは流暢な英語で書かれた出力で疑念を回避する。不正確なアサーションであっても、流暢に記述されていれば人間のレビューを通過してしまう。これは開発者の欠点ではなく、流暢さが真実とみなされるというよく知られたバイアス(fluency = truth)をLLMという媒体が増幅させているのだ。関連する「ハイプ疲れ」の流れとして、洗練された出力を目視で判断する人間が介在することの価値を過大評価していた可能性がある。
注目すべき製品の反応が2つある:(a)IDEがIAによるアサーションに対し「受諾/却下」を超えた明確な不確実性を表示すること;(b)チームが目視レビューではなく自動レビュー(実行されるテスト、検証されるプロパティ)に移行すること。
本記事は人工知能により作成され、人間の編集管理のもとで校閲されています。
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness