« Poor and overconfident »: os devs são maus juízes das afirmações dos LLMs

Seguimento do caso : Fatigue hype 2026 : le tri entre modèle et harness· Episódio 2/16

Criar Jul 13, 2026 at 09:137Adicionar aos favoritos

« Poor and overconfident »: os devs são maus juízes das afirmações dos LLMs
Ilustração : Léa Fontaine

Novo artigo arXiv: os programadores não são apenas maus juízes das asserções geradas por LLM — eles são excessivamente confiantes em seus julgamentos. A combinação que prejudica a revisão de código por IA.

O fato

O artigo « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 de julho de 2026) documenta empiricamente um padrão preocupante: quando pedimos a desenvolvedores que avaliem asserções geradas por LLM em código, eles frequentemente erram — e acreditam estar corretos. A compreensão e revisão de código, no entanto, são tarefas centrais da profissão, ainda mais desde a chegada das ferramentas generativas.

Nossa leitura

Esse resultado se soma a um conjunto crescente de evidências: os LLMs embelezam suas saídas com uma eloquência que contorna a dúvida. Uma asserção mal formulada, mas escrita em inglês fluente, passa pela revisão humana. Não é um defeito dos desenvolvedores — é um viés conhecido (fluency = truth) que o meio LLM amplifica. Corolário no debate sobre "hype-fatigue": provavelmente superestimamos o valor do "human in the loop" quando esse humano julga a olho nu uma saída polida.

A se observar

Duas reações de produto a serem monitoradas: (a) IDEs que exibem uma incerteza visível nas asserções geradas por IA (além de "aceito / rejeitado"); (b) equipes que migram para uma revisão automática (testes executados, propriedades verificadas) em vez de visual.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

8 pessoas gostaram deste artigo

Gosto
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
Partilhar:
Comentários (7)

Inicie sessão para se juntar à discussão.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

O fio do caso

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Eu amo LLMs, odeio hype » - geohot lembra a única regra que resta13/07/2026
  2. 2« Poor and overconfident »: os devs são maus juízes das afirmações dos LLMs13/07/2026
  3. 3Como os profissionais de software realmente julgam o código gerado por IA?13/07/2026
  4. 4Zig, Zed, Anthropic: quando um criador de linguagem chama o hype pelo nome13/07/2026
  5. 5"Os críticos de LLMs têm razão. Eu uso LLMs mesmo assim" - la voix qui recompose16/07/2026
  6. 6O custo de dizer sim mudou: GitHub relança o debate sobre o verdadeiro gargalo17/07/2026
  7. 7« Código Claude: Anatomia de uma Má-Feature » - quando a revisão pública se torna o verdadeiro QA17/07/2026
  8. 8O Google's Gemini 3.6 Flash é mais barato e mais curto - e o Gemini 4 ganha um teaser enquanto o 3.5 Pro continua atrasado22/07/2026
  9. 9A IA não tornou a programação mais fácil, apenas a tornou difícil de outra forma - CACM acerta na frase anti-hype22/07/2026
  10. 10"As IA estatal não resolverá a desigualdade": a tese crua do Rest of World sobre as IAs nacionais do Sul Global24/07/2026
  11. 11Refatoração como alavanca de custo de token: um experimento na série de gen-AI de Fowler30/07/2026
  12. 12Rachel Laycock: "a atenção tornou-se o recurso raro" - o dev-orquestrador, entre 8 e 12 agentes em paralelo31/07/2026
  13. 13Situational Awareness perde 67 % em um mês: o julgamento das verdadeiras crentes02/08/2026
  14. 14OpenAI « Astra » teria resolvido 10 problemas abertos em matemática e ciência da computação — aguardemos as provas02/08/2026
  15. 15« Cancelling Cursor »: a dívida técnica sobrepõe-se à velocidade de entrega de funcionalidades02/08/2026
  16. 16Jeff Dean sobre o que as equipes de IA erram: o diagnóstico da oficina que paga todas as contas03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações