Ремесло Jul 13, 2026 at 09:137В закладки

Новая статья на arXiv: программисты не только плохо оценивают утверждения, сгенерированные LLM — они излишне уверены в своих суждениях. Этот дуэт подрывает ревью кода с использованием ИИ.
Статья « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 июля 2026 г.) эмпирически документирует тревожную закономерность: когда разработчиков просят оценить утверждения, сгенерированные LLM в коде, они часто ошибаются — и при этом уверены в своей правоте. Понимание и ревью кода остаются центральными задачами профессии, особенно с появлением генеративных инструментов.
Этот результат добавляется к растущему корпусу данных: LLMs облекают свои выводы в такую убедительную форму, что это обходит сомнения. Плохо сформированное утверждение, но написанное на беглом английском, проходит человеческую проверку. Это не вина разработчиков — это хорошо известное смещение (fluency = truth), которое LLM-среда усиливает. Следствие в русле «усталости от хайпа»: вероятно, мы переоценили ценность «человека в цикле», когда этот человек оценивает на глаз отполированный вывод.
Стоит следить за двумя реакциями на продукт: (a) IDE, которые отображают видимую неопределённость в отношении утверждений от ИИ (не только «принято / отклонено»); (b) команды, которые переходят на автоматическую проверку (выполняемые тесты, проверка свойств) вместо визуальной.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness