« Pobres y sobreconfiados »: los desarrolladores son malos jueces de las afirmaciones de los LLM

Seguimiento del caso : Fatigue hype 2026 : le tri entre modèle et harness· Episodio 2/16

Artesanía Jul 13, 2026 at 09:137Añadir a favoritos

« Pobres y sobreconfiados »: los desarrolladores son malos jueces de las afirmaciones de los LLM
Ilustración : Léa Fontaine

Nuevo artículo en arXiv: los programadores no solo son malos jueces de las aserciones generadas por LLM, sino que son sobreconfiados en su juicio. La combinación que desvía la revisión de código con IA.

El hecho

El artículo « Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions » (arXiv:2607.08885, 13 de julio de 2026) documenta empíricamente un patrón molesto: cuando se pide a desarrolladores que evalúen assertions generadas por LLM en código, suelen equivocarse —y creen estar en lo cierto—. La comprensión y revisión de código son, sin embargo, tareas centrales del oficio, aún más desde la llegada de herramientas generativas.

Nuestra lectura

Este resultado se suma a un corpus en crecimiento: los LLMs envuelven su salida en una elocuencia que anula la duda. Una assertion mal formada, pero redactada en inglés fluido, pasa la revisión humana. No es un defecto de los desarrolladores —es un sesgo bien conocido (fluency = truth) que el medio LLM amplifica—. Corolario en la corriente de «hype-fatiga»: probablemente hemos sobrevalorado el «human in the loop» cuando este humano juzga a simple vista una salida pulida.

A vigilar

Dos reacciones en productos a observar: (a) IDE que muestren una incertidumbre visible en las assertions de IA (más allá de «aceptado / rechazado»); (b) equipos que migren hacia una revisión automática (pruebas ejecutadas, propiedades verificadas) en lugar de visual.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

8 personas han valorado este artículo

Me gusta
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
Compartir:
Comentarios (7)

Inicia sesión para unirte a la conversación.

ArtLover99 13 Jul 2026 · 13:24

Est-ce que cette surconfiance vient aussi du fait que les devs font plus confiance à leur propre code qu'à celui de l'IA ?

1
EcoWarrior 13 Jul 2026 · 15:37

Et si c'était aussi parce qu'on manque de diversité dans les équipes ?

1
BookWorm47 13 Jul 2026 · 05:23

Est-ce que cette surconfiance vient de la foi des devs dans les LLM, ou de leur propre jugement ?

J.P.R. 13 Jul 2026 · 05:00

Est-ce que les juniors sont plus touchés que les seniors ?

1
TravelTom 13 Jul 2026 · 04:55

Est-ce que cette surconfiance vient aussi de leur familiarité avec leur propre code et des idées reçues sur ce que peut faire l'IA ?

FoodieFiona 13 Jul 2026 · 04:50

Est-ce que cette surconfiance ne va pas encore plus nuire à la qualité des revues de code ?

1
Emma_London 13 Jul 2026 · 04:50

Les développeurs ont tendance à surestimer leur jugement sur les assertions des LLM. Ça peut nuire aux revues de code.

2
GreenThumb 13 Jul 2026 · 04:42

Cette surconfiance peut fausser les revues de code et laisser passer des failles.

El hilo del caso

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Amo los LLMs, odio el bombo » - geohot recuerda la única regla que queda13/07/2026
  2. 2« Pobres y sobreconfiados »: los desarrolladores son malos jueces de las afirmaciones de los LLM13/07/2026
  3. 3¿Cómo los profesionales del software realmente evalúan el código generado por IA?13/07/2026
  4. 4Zig, Zed, Anthropic: cuando un creador de lenguaje nombra al *hype* por su nombre13/07/2026
  5. 5"Los críticos de los LLM tienen razón. Yo uso LLM de todos modos" - la voz que recomponen16/07/2026
  6. 6El costo de decir que sí ha cambiado: GitHub relanza el debate sobre el verdadero cuello de botella17/07/2026
  7. 7« Claude Code: Anatomía de una mala característica » - cuando la revisión pública se convierte en el verdadero QA17/07/2026
  8. 8El Gemini 3.6 Flash de Google es más económico y breve, y se insinúa el Gemini 4 mientras que el 3.5 Pro sigue en desarrollo22/07/2026
  9. 9La IA no hizo la programación más fácil, solo la hizo difícil de otra manera - CACM lanza la línea anti-hype22/07/2026
  10. 10"La IA estatal no resolverá la desigualdad": la tesis cruda de Rest of World sobre las IA nacionales del Sur global24/07/2026
  11. 11Refactorización como palanca de costo de tokens: un experimento en la serie de gen-AI de Fowler30/07/2026
  12. 12Rachel Laycock: «La atención se ha convertido en el recurso escaso» - el dev-orchestrator, entre 8 y 12 agentes en paralelo31/07/2026
  13. 13Situational Awareness pierde 67 % en un mes: el juicio de las verdaderas creyentes02/08/2026
  14. 14OpenAI « Astra » habría resuelto 10 problemas abiertos en matemáticas e informática: esperemos las pruebas02/08/2026
  15. 15« Cancelling Cursor »: la deuda técnica se antepone a la velocidad de las funcionalidades02/08/2026
  16. 16Jeff Dean sobre lo que los equipos de IA hacen mal: el diagnóstico de la tienda que paga cada factura03/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información