Modelos y Herramientas just now8Añadir a favoritos
Un documento de posición publicado en OpenReview cuestiona una suposición central de la tesis de escalamiento de la IA: que la capacidad de razonamiento mejora indefinidamente con la escala. El argumento no es nuevo, pero el enfoque es más contundente de lo habitual.
El hecho Un artículo de posición titulado « LLMs Can't Jump » fue presentado en OpenReview (5 de agosto de 2026, 30 puntos en HN, 11 comentarios). Basado en el título y las discusiones en HN —el contenido completo del paper no es accesible públicamente en esta etapa—, la tesis parece argumentar que los LLMs presentan un límite fundamental en ciertas tareas de razonamiento: capacidades que parecen adquiridas en ejemplos simples colapsan en variantes más complejas, sin que el escalado por sí solo resuelva el problema.
Nuestra lectura Si la tesis se confirma al leer el contenido, se alinea con un corpus crítico en crecimiento —trabajos sobre la « reversal curse », fallos en ARC-AGI, análisis de François Chollet sobre generalización—. El argumento no se centraría en el rendimiento bruto (los benchmarks mejoran), sino en la naturaleza del razonamiento: reconocimiento de patrones en lugar de razonamiento composicional. La consecuencia práctica sería que los benchmarks estandarizados (GSM8K, MATH) sobrestiman las capacidades reales, ya que forman parte de la distribución de entrenamiento. Debe tratarse con precaución hasta la revisión por pares completa: un título y una puntuación en HN no hacen una tesis verificada.
A vigilar La versión completa publicada del paper y las respuestas de los laboratorios (OpenAI, Anthropic, DeepMind), que tendrán todo el interés en refutar o matizar estas limitaciones si se confirman.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
So much for the
But can we really talk about "reasoning" when the model’s outputs are just probabilistic pattern-matching? The paper might be missing the forest for the trees.
The paper’s focus on symbolic reasoning feels too narrow-what about the emergent behaviors we’re already seeing? Seems like declaring a ceiling too early.
Interesting take, but isn't the problem that we're still measuring reasoning by human benchmarks? LLMs might not "jump", but they might scale in ways we haven't even imagined yet.
Isn't the real question whether current architectures hit a ceiling *before* reaching human-like reasoning? Maybe the problem isn't scale but the fundamental limits of language-based models.
LLMs might hit a ceiling in formal reasoning, but their real-world adaptability could still outpace human limits in messy, dynamic environments.
The paper overstates its case by conflating mathematical reasoning with general problem-solving. Why assume the ceiling applies to all domains, not just symbolic tasks?
The real ceiling might not be the models’ limits but our own-assuming we can keep scaling up without addressing the resource cost. How long before we call that a ceiling?
Fatigue hype 2026 : le tri entre modèle et harness