El arqueólogo y su copiloto: Malykhin disciplina el LLM en Java 1.5

Seguimiento del caso : Harness Ops : post-mortems et bench des agents en prod· Episodio 7/17

Artesanía Jul 16, 2026 at 17:457Añadir a favoritos

El arqueólogo y su copiloto: Malykhin disciplina el LLM en Java 1.5
Ilustración : Léa Fontaine

Nik Malykhin debía ejecutar una base Java 1.5 en hardware moderno. Las primeras respuestas de su LLM eran plausibles, pero no se sostenían en el repositorio. La solución: dejar de creerle a ciegas y obligarlo a respaldarse en pruebas.

En términos sencillos

Un LLM lanzado sobre código heredado produce respuestas que suenan correctas pero no encajan con el proyecto. La disciplina que funciona: forzar al asistente a trabajar a partir de pruebas —código, tests, artefactos— en lugar de desde su memoria.

El arqueólogo en acción

Nik Malykhin contaba el 16 de julio de 2026 en martinfowler.com su modernización de una base Java 1.5 hacia un entorno reciente. El contexto no es común: las herramientas modernas de análisis y refactorización no soportan bien Java 1.5, y muchas ni siquiera lo aceptan. Su primer instinto —pedir correcciones directas al asistente— generó lo que Malykhin describe como respuestas "plausibles" que "did not hold up in the codebase": parecen buen Java 1.5, pero no coinciden con el repositorio real.

El cambio es metodológico. En lugar de usar el LLM como redactor, Malykhin lo usó como analista y verificador, anclando cada paso en el repositorio: lectura atenta del código existente, validación de hipótesis sobre tests y trazas de ejecución, rechazo a ir más rápido de lo que el propio código permite afirmar. El mensaje del artículo es simple: modernizar legacy con un LLM no va más rápido que un arqueólogo, va igual de lento, pero con menos agujeros en la demostración.

Bajo el capó

El patrón tiene varios nombres en la instrumentación moderna de agentes —evidence-first prompting, grounded reasoning, retrieval-first— pero se basa en una misma regla: cada afirmación del asistente debe respaldarse en un artefacto del repositorio (un archivo, una línea, un test). La ausencia de esta restricción es lo que produce los "falsos positivos" más costosos de un LLM sobre legacy: APIs posteriores a la versión objetivo, métodos que no existen, imports fantasma.

Entonces, ¿qué?

Para los equipos que trabajan con legacy, el "copiloto" no sirve para escribir, sirve para encontrar. La verdadera productividad viene de hacer que el LLM lea, no de dejarlo adivinar. El corolario para un CTO: las buenas métricas de un proyecto de modernización asistido por IA no son "líneas generadas", sino "hipótesis refutadas por el propio código". La diferencia entre ambas es la que separa un proyecto legacy que llega a buen puerto de uno que vuelve a caer en deuda técnica.

Resources

Artículo producido por inteligencia artificial, revisado bajo control editorial humano.

Nuestra redacción
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
¿Te ha resultado útil este artículo?

31 personas han valorado este artículo

Me gusta
M
Mateo RossiSoftware architect
🇬🇧 Architect, two decades of production systems.
Compartir:
Comentarios (7)

Inicia sesión para unirte a la conversación.

Alex 2 17 Jul 2026 · 05:46

Interesting approach. Does this method also work for other legacy systems, or is it specific to Java 1.5?

J.P.R. 2 16 Jul 2026 · 17:46

Est-ce qu'on peut vérifier les suggestions du LLM avant de les implémenter, surtout sur un vieux système comme Java 1.5 ?

Dr. J. 16 Jul 2026 · 17:29

On pourrait tester les propositions du LLM dans un environnement isolé avant de les appliquer au système principal ?

ArtLoverLA 16 Jul 2026 · 13:57

Est-ce que ça marche aussi sur des gros projets Java 1.5 ?

1
CriticAtHeart 16 Jul 2026 · 16:03

Est-ce que ça marche aussi sur des gros projets Java 1.5 ? Les LLM ont du mal avec le code ancien très imbriqué, leurs suggestions sont moins fiables.

BookWorm47 16 Jul 2026 · 13:35

Est-ce que ça marcherait aussi pour d'autres vieux systèmes ?

SkepticSam 16 Jul 2026 · 13:25

Intéressant, mais comment ça se passe avec d'autres langages anciens ?

Alex_LDN 16 Jul 2026 · 13:17

Les LLMs pourraient-ils vraiment sauver nos vieux systèmes ?

El hilo del caso

Harness Ops : post-mortems et bench des agents en prod

  1. 1Migrar un agente de producción a GPT-5.6: 2,2× más rápido, 27 % más económico - el verdadero informe post mortem13/07/2026
  2. 233k vs 7k tokens: lo que revela la sobrecarga comparada de Claude Code y OpenCode13/07/2026
  3. 3Google Genkit v.Agents: *detached turns* y *human-in-the-loop* salen en preview14/07/2026
  4. 4Tres bucles en un trench-coat: la anatomía real de un agente14/07/2026
  5. 5« Loop engineering »: ¿nueva disciplina o relanzamiento de los *cron jobs*?15/07/2026
  6. 6Benchmark Stripe: los agentes conectan las API, no las validan15/07/2026
  7. 7El arqueólogo y su copiloto: Malykhin disciplina el LLM en Java 1.516/07/2026
  8. 8QCon AI Boston: « prompts → plataformas, arneses, evaluaciones » - el terreno valida la tesis17/07/2026
  9. 9Más allá de grep: la tesis del arnés de codificación de IA rico en contexto20/07/2026
  10. 10InAgent alcanza 90.2% en OSWorld: la brecha del agente de uso informático se reduce para la pila china03/08/2026
  11. 11Wallfacer: un gestor de sesiones de terminal construido para Claude Code y flujos de trabajo multiagente06/08/2026
  12. 12Claude Code inter-sesión de mensajería se envía: la coordinación entre agentes obtiene su primera primitiva nativa08/08/2026
  13. 13Las habilidades de los agentes de IA se están estandarizando: Codex y VS Code están dentro, Claude aún no.10/08/2026
  14. 14Los agentes de IA mienten, engañan y roban, y esto está frenando su adopción más que cualquier métrica puede medir.13/08/2026
  15. 15La ingeniería de contexto: por qué 300 tokens bien elegidos superan a 100k ruidosos14/08/2026
  16. 16OneCLI (YC S26) incluye un entorno de pruebas aislado de código abierto: la solución a escala de equipo para Claude Code19/08/2026
  17. 17Cursor Origin y el problema de control de versiones de agentes: Por qué Git nunca fue diseñado para esto25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secciones
Explorar
Información