Criar Jul 13, 2026 at 09:137Adicionar aos favoritos

Novo artigo arXiv: os programadores não são apenas maus juízes das asserções geradas por LLM — eles são excessivamente confiantes em seus julgamentos. A combinação que prejudica a revisão de código por IA.
O artigo « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 de julho de 2026) documenta empiricamente um padrão preocupante: quando pedimos a desenvolvedores que avaliem asserções geradas por LLM em código, eles frequentemente erram — e acreditam estar corretos. A compreensão e revisão de código, no entanto, são tarefas centrais da profissão, ainda mais desde a chegada das ferramentas generativas.
Esse resultado se soma a um conjunto crescente de evidências: os LLMs embelezam suas saídas com uma eloquência que contorna a dúvida. Uma asserção mal formulada, mas escrita em inglês fluente, passa pela revisão humana. Não é um defeito dos desenvolvedores — é um viés conhecido (fluency = truth) que o meio LLM amplifica. Corolário no debate sobre "hype-fatigue": provavelmente superestimamos o valor do "human in the loop" quando esse humano julga a olho nu uma saída polida.
Duas reações de produto a serem monitoradas: (a) IDEs que exibem uma incerteza visível nas asserções geradas por IA (além de "aceito / rejeitado"); (b) equipes que migram para uma revisão automática (testes executados, propriedades verificadas) em vez de visual.
Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.
Inicie sessão para se juntar à discussão.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness