« Бедные и самонадеянные» : разработчики плохо судят утверждения LLM

Продолжение истории : Fatigue hype 2026 : le tri entre modèle et harness· Часть 2/16

Ремесло Jul 13, 2026 at 09:137В закладки

« Бедные и самонадеянные» : разработчики плохо судят утверждения LLM
Иллюстрация : Léa Fontaine

Новая статья на arXiv: программисты не только плохо оценивают утверждения, сгенерированные LLM — они излишне уверены в своих суждениях. Этот дуэт срывает ревью кода с использованием ИИ.

Факт

Статья « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 июля 2026 г.) эмпирически документирует тревожную закономерность: когда разработчиков просят оценить утверждения, сгенерированные LLM для кода, они часто ошибаются — и при этом уверены в своей правоте. Понимание и ревью кода, тем не менее, остаются центральными задачами профессии, особенно с появлением генеративных инструментов.

Наше мнение

Этот результат добавляется к растущему корпусу данных: LLM облекают свои выводы в такую изысканную формулировку, что это обходит стороной сомнения. Плохо сформированное утверждение, но написанное на беглом английском, проходит человеческую проверку. Это не вина разработчиков — это хорошо известное смещение (fluency = truth), которое LLM только усиливают. Следствие в русле «усталости от хайпа»: мы, вероятно, переоценили ценность «человека в цикле», когда этот человек судит на глазок тщательно отполированный вывод.

На что обратить внимание

Стоит следить за двумя реакциями на продукт: (a) IDE, которые отображают видимую неопределённость в отношении утверждений от ИИ (не только «принято / отклонено»); (b) команды, которые переходят к автоматическому ревью (выполняемые тесты, проверка свойств) вместо визуального.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

8 чел. оценили эту статью

Нравится
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
Поделиться:
Комментарии (7)

Войдите, чтобы участвовать в обсуждении.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

Хронология истории

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Я люблю LLMs, ненавижу хайп » - geohot напоминает единственное оставшееся правило13/07/2026
  2. 2« Бедные и самонадеянные» : разработчики плохо судят утверждения LLM13/07/2026
  3. 3Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?13/07/2026
  4. 4Zig, Zed, Anthropic: когда творец языка называет хайп своим именем13/07/2026
  5. 5"Критики LLM правы. Но я всё равно использую LLM" — голос, который пересобирает16/07/2026
  6. 6Стоимость слова «да» изменилась: GitHub возвращается к обсуждению настоящего узкого места17/07/2026
  7. 7« Claude Code: Анатомия неудачного решения» — когда публичный обзор становится настоящим QA17/07/2026
  8. 8Google's Gemini 3.6 Flash дешевле и короче — а Gemini 4 получает анонс, в то время как 3.5 Pro остаётся доступным.22/07/2026
  9. 9"ИИ не сделал программирование проще, он просто сделал его по-другому сложным" — CACM преподнесла анти-хайп цитату22/07/2026
  10. 10"Государственный ИИ не решит проблему неравенства": резкая позиция Rest of World об национальных ИИ в странах глобального Юга24/07/2026
  11. 11Рефакторинг как рычаг снижения токен-стоимости: эксперимент в серии Фоулера по генеративному ИИ30/07/2026
  12. 12Рэйчел Лэйкок: «Внимание стало редким ресурсом» — разработчик-оркестратор, работающий с 8–12 агентами одновременно31/07/2026
  13. 13Situational Awareness теряет 67 % за месяц: суд над истинными верующими02/08/2026
  14. 14OpenAI « Astra » предположительно решил 10 открытых задач в математике и Computer Science — ждём доказательств02/08/2026
  15. 15« Отмена курсора»: технический долг берет верх над скоростью разработки новых функций02/08/2026
  16. 16Джефф Дин о том, что команды по ИИ делают не так: диагноз от того, кто платит по всем счетам03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация