Artesanía Jul 13, 2026 at 09:137Añadir a favoritos

Nuevo artículo en arXiv: los programadores no solo son malos jueces de las aserciones generadas por LLM, sino que son sobreconfiados en su juicio. La combinación que desvía la revisión de código con IA.
El artículo « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 de julio de 2026) documenta empíricamente un patrón molesto: cuando se pide a desarrolladores que evalúen assertions generadas por LLM en código, suelen equivocarse —y creen estar en lo cierto—. La comprensión y revisión de código son, sin embargo, tareas centrales del oficio, aún más desde la llegada de herramientas generativas.
Este resultado se suma a un corpus en crecimiento: los LLMs envuelven su salida en una elocuencia que anula la duda. Una assertion mal formada, pero redactada en inglés fluido, pasa la revisión humana. No es un defecto de los desarrolladores —es un sesgo bien conocido (fluency = truth) que el medio LLM amplifica—. Corolario en la corriente de «hype-fatiga»: probablemente hemos sobrevalorado el «human in the loop» cuando este humano juzga a simple vista una salida pulida.
Dos reacciones en productos a observar: (a) IDE que muestren una incertidumbre visible en las assertions de IA (más allá de «aceptado / rechazado»); (b) equipos que migren hacia una revisión automática (pruebas ejecutadas, propiedades verificadas) en lugar de visual.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?
Et si c'était aussi parce qu'on manque de diversité dans les équipes ?
Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?
Est-ce que les juniors sont plus touchés que les seniors ?
Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?
Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?
Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.
Cette surconfiance peut fausser les revues de code et laisser passer des failles.
Fatigue hype 2026 : le tri entre modèle et harness