Ремесло Jul 13, 2026 at 09:137В закладки

Новая статья на arXiv: программисты не только плохо оценивают утверждения, сгенерированные LLM — они излишне уверены в своих суждениях. Этот дуэт срывает ревью кода с использованием ИИ.
Статья « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 июля 2026 г.) эмпирически документирует тревожную закономерность: когда разработчиков просят оценить утверждения, сгенерированные LLM для кода, они часто ошибаются — и при этом уверены в своей правоте. Понимание и ревью кода, тем не менее, остаются центральными задачами профессии, особенно с появлением генеративных инструментов.
Этот результат добавляется к растущему корпусу данных: LLM облекают свои выводы в такую изысканную формулировку, что это обходит стороной сомнения. Плохо сформированное утверждение, но написанное на беглом английском, проходит человеческую проверку. Это не вина разработчиков — это хорошо известное смещение (fluency = truth), которое LLM только усиливают. Следствие в русле «усталости от хайпа»: мы, вероятно, переоценили ценность «человека в цикле», когда этот человек судит на глазок тщательно отполированный вывод.
Стоит следить за двумя реакциями на продукт: (a) IDE, которые отображают видимую неопределённость в отношении утверждений от ИИ (не только «принято / отклонено»); (b) команды, которые переходят к автоматическому ревью (выполняемые тесты, проверка свойств) вместо визуального.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness