Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?

Продолжение истории : Fatigue hype 2026 : le tri entre modèle et harness· Часть 3/33

Ремесло Jul 13, 2026 at 09:1412В закладки

Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?
Иллюстрация : Léa Fontaine

Зарегистрированный отчёт на arXiv затрагивает вопрос, который избегали: какие критерии и какие предвзятости разработчики используют при принятии решения о включении или отклонении кода LLM. Это эмпирическая основа, которой не хватало в дебатах.

Простыми словами

В статье, опубликованной на arXiv 13 июля 2026 года (arXiv:2607.09434), формализовано, в формате Registered Report, исследование о том, как профессиональные разработчики оценивают код, сгенерированный такими инструментами, как Copilot, ChatGPT или Claude. Иными словами: первая попытка строгого измерения того, что на практике означает «принятие кода от ИИ».

Что даёт такой подход

Registered Report публикует протокол (вопросы, гипотезы, план анализа) до сбора данных — методология проходит рецензирование заранее, а результаты публикуются независимо от их знака. Этот формат, заимствованный из экспериментальной психологии, исключает p-hacking и постфактумное сочинительство. Его появление в Software Engineering само по себе сигнализирует: эта область наконец требует надёжных доказательств, а не демонстрационных анекдотов. Резюме на arXiv чётко об этом заявляет: спустя несколько лет после появления Copilot в литературе до сих пор нет эмпирических оснований для главного действия — человеческой ревью кода от ИИ.

Анализ — почему это важно для профессии

1. Пробел в знаниях. Мы измеряем скорость генерации, количество принятий в редакторе, списанные токены. Но мы не измеряем — по-настоящему — критерии качества, которые разработчики используют, когда кликают «принять». Эта статья как раз нацелена на эту слепую зону.

2. Связь с темой «хайп-усталости». Другая статья на arXiv, опубликованная в тот же день («Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions», arXiv:2607.08885), предполагает, что разработчики переоценивают свою способность оценивать выводы LLM. Вместе эти работы рисуют неудобную картину: мы оцениваем быстро, оцениваем плохо, но уверены в себе. Это заставляет переосмыслить рабочие процессы — больше автоматизированных защит на выходе, меньше доверия к человеческому глазу на входе.

3. Что может извлечь из этого craft прямо сейчас. Два конкретных шага: (a) делать ревью кода от ИИ явным (краткий чек-лист: intent, инварианты, крайние случаи) вместо неявного; (b) измерять у себя инциденты после мержа, связанные с кодом от ИИ, «принятым без обсуждения».

Итог

Для технического директора: не ждать окончательных результатов, чтобы действовать. Запрос на эмпирические основы для оценки «как мы оцениваем код от ИИ» уже сам по себе стратегический. Инструментируйте свои собственные процессы принятия — организации, у которых будут данные о своих разработчиках, получат реальное преимущество перед теми, кто управляет ревью на интуиции.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

9 чел. оценили эту статью

Нравится
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
Поделиться:
Комментарии (12)

Войдите, чтобы участвовать в обсуждении.

LecteurDuDimanche 14 Jul 2026 · 07:41

Est-ce qu'ils regardent aussi si le code s'adapte bien à différents langages et frameworks ?

2
unLecteurCurieux 14 Jul 2026 · 07:14

Est-ce qu'ils vérifient aussi si le code tient dans le temps ?

1
ph1lippe_m 13 Jul 2026 · 13:26

Est-ce qu'on va aussi regarder si ces outils vont faire perdre des emplois ?

Dr. L. 13 Jul 2026 · 13:16

Est-ce qu'un jour on évaluera aussi l'éthique de l'IA dans le code ?

GreenThumb 13 Jul 2026 · 13:14

Et l'impact écologique de l'entraînement et de l'usage de ces modèles ?

1
J.P.R. 13 Jul 2026 · 12:59

Est-ce qu'on va perdre en créativité avec le code généré par IA ?

J.P.R. 2 13 Jul 2026 · 12:43

Est-ce qu'on va aussi vérifier si le code tient sur la durée ?

le_sceptique 13 Jul 2026 · 05:34

Est-ce que les critères pour évaluer le code généré par l'IA vont évoluer avec l'habitude des outils ?

Alex_LDN 13 Jul 2026 · 05:26

Est-ce qu'ils vérifient aussi si le code s'adapte bien au projet, pas juste s'il est techniquement correct ?

Alex 13 Jul 2026 · 05:26

Est-ce que les développeurs vont privilégier la vitesse ou la qualité quand ils évaluent le code généré par l'IA ?

LitLover42 13 Jul 2026 · 05:17

Est-ce qu'on juge le code IA avec les mêmes critères que celui des humains ? Les biais viennent-ils de l'IA ou de nous ?

1
curio_usa 13 Jul 2026 · 04:50

Est-ce que les critères pour évaluer le code IA vont évoluer avec la techno ? Comment les devs vont s'adapter ?

1
Хронология истории

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Я люблю LLMs, ненавижу хайп » - geohot напоминает единственное оставшееся правило13/07/2026
  2. 2« Бедные и самонадеянные »: разработчики плохо судят утверждения LLM13/07/2026
  3. 3Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?13/07/2026
  4. 4Zig, Zed, Anthropic: когда творец языка называет хайп своим именем13/07/2026
  5. 5"Критики LLM правы. Но я всё равно использую LLM" — голос, который пересобирает16/07/2026
  6. 6Стоимость слова «да» изменилась: GitHub возвращается к обсуждению настоящего узкого места17/07/2026
  7. 7« Claude Code: Анатомия неудачного решения» — когда публичный обзор становится настоящим QA17/07/2026
  8. 8Google's Gemini 3.6 Flash дешевле и короче — а Gemini 4 получает анонс, в то время как 3.5 Pro остаётся доступным.22/07/2026
  9. 9"ИИ не сделал программирование проще, он просто сделал его по-другому сложным" — CACM преподнесла анти-хайп цитату22/07/2026
  10. 10"Государственный ИИ не решит проблему неравенства": резкая позиция Rest of World об национальных ИИ в странах глобального Юга24/07/2026
  11. 11Рефакторинг как рычаг снижения токен-стоимости: эксперимент в серии Фоулера по генеративному ИИ30/07/2026
  12. 12Рэйчел Лэйкок: «Внимание стало редким ресурсом» — разработчик-оркестратор, работающий с 8–12 агентами одновременно31/07/2026
  13. 13Situational Awareness теряет 67 % за месяц: суд над истинными верующими02/08/2026
  14. 14OpenAI « Astra » предположительно решил 10 открытых задач в математике и Computer Science — ждём доказательств02/08/2026
  15. 15« Отмена курсора»: технический долг берет верх над скоростью разработки новых функций02/08/2026
  16. 16Джефф Дин о том, что команды по ИИ делают не так: диагноз от того, кто платит по всем счетам03/08/2026
  17. 17Искусственный пузырь спроса: разделение реальных расходов и искусственно созданного ажиотажа04/08/2026
  18. 18Бенчмарки ИИ достигают насыщения — и у нас заканчиваются способы измерения прогресса.04/08/2026
  19. 19Google и Amazon's AI earnings делают Frontier Case актуальным — доступ к Frontier является настоящим разделителем05/08/2026
  20. 20Агентный ИИ достигает пика ажиотажа в цикле ажиотажа Gartner Japan 2026 — теневой ИИ становится реальным пробелом в управлении05/08/2026
  21. 21Правительства делают опасную ставку на бум искусственного интеллекта — The Economist называет риски06/08/2026
  22. 22Amundi: ИИ остаётся долгосрочной ставкой несмотря на распродажу — что видит крупнейший в Европе управляющий активами06/08/2026
  23. 23Palantir's 93% рост выручки во 2 квартале: что такое корпоративный ИИ, когда он действительно внедряется08/08/2026
  24. 24"LLM не могут прыгать": аналитическая статья, утверждающая, что у больших языковых моделей есть фундаментальный предел рассуждений08/08/2026
  25. 25Понимание — это архитектурная характеристика, и сгенерированный ИИ код не справляется с ней.13/08/2026
  26. 26TEMU-фикация программного обеспечения: дешёвое, доступное и всё сложнее продавать14/08/2026
  27. 27Почему работать с Opus 5 кажется хуже — и что это говорит об оценке моделей14/08/2026
  28. 28Xiaomi 17 Ultra принял Луну за Солнце — обработка фото с помощью ИИ всё ещё обманывает вас14/08/2026
  29. 29Anthropic's Conceptual Reasoning Index нацелен на проблему загрязнения бенчмарков18/08/2026
  30. 30AI-трейдинг подтолкнул волатильность японских акций до 18-летнего максимума — риск концентрации становится измеримым19/08/2026
  31. 31Экономика создателей и её ИИ-революция: когда жажда денег теряет аудиторию24/08/2026
  32. 32Я становлюсь ИИ-слепым — и это реальная проблема24/08/2026
  33. 33OpenAI's модель 'Astra' заявляет о решении 10 открытых математических задач — когда ИИ перестаёт тестироваться и начинает открывать новое25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация