Modelos e Herramientas Aug 25, 2026 at 16:277Añadir a favoritos

Un modelo interno de OpenAI reportedly resolvió diez problemas abiertos en matemáticas y ciencias de la computación. Si se verifica, esto representa un umbral cualitativo: no una mejor puntuación en una prueba conocida, sino conocimiento novedoso en dominios donde expertos humanos no habían tenido éxito. La pregunta de verificación es toda la historia, y tomará semanas, no días.
Los modelos de IA suelen probarse con problemas que tienen respuestas conocidas. La afirmación aquí es categóricamente distinta: un modelo interno no publicado, según se informa, resolvió problemas que investigadores humanos aún no habían logrado. La fuente de esta afirmación es débil: un tuit, enlazado por una publicación de Hacker News de bajo tráfico. Esa debilidad es parte de lo que aborda este artículo.
Una publicación en Hacker News (9 puntos, 0 comentarios al momento de escribir esto) enlaza a un tuit de @polynoamial que describe un modelo interno de OpenAI resolviendo diez problemas abiertos en matemáticas y ciencias de la computación. El modelo lleva el nombre interno "Astra", distinto del Project Astra de Google DeepMind y no es un sistema de acceso público.
Esta es la cadena de fuentes: tuit → enlace en HN sin discusión → nuestra cobertura. Esa cadena es débil. La razón por la que vale la pena cubrirlo no es la afirmación en sí, sino lo que esta clase de afirmaciones representa en la evolución de la comunicación de capacidades.
'Resuelto' en los anuncios de IA generalmente significa 'propuesta una solución que parece correcta' — no 'producido una prueba formal verificada por máquina'. La brecha es enorme en matemáticas formales. Un modelo puede proponer una respuesta convincente a un problema abierto que contiene un error sutil que los expertos tardan semanas en encontrar. Hasta que las soluciones sean verificadas formalmente por matemáticos independientes, la afirmación no está confirmada, independientemente de lo capaz que suene el modelo.
Si se verifica de manera independiente: esto representaría un umbral en el razonamiento automatizado que la mayoría de los investigadores habían situado más lejos. No otra mejora en métricas — un sistema de IA que genera nuevo conocimiento matemático. Las implicaciones en productividad investigadora para los departamentos de matemáticas y ciencias de la computación serían estructurales.
El plazo de verificación para problemas abiertos genuinos es de semanas a meses. El consenso de la comunidad matemática sobre una prueba no trivial lleva tiempo incluso cuando los matemáticos humanos la presentan. Una solución generada por IA enfrenta el escrutinio adecuado que no puede ser acelerado.
Esta clase de afirmaciones —"resolvimos problemas abiertos" en lugar de "mejoramos las puntuaciones en métricas"— es más difícil de evaluar, de mayor riesgo y más inmune a las críticas estándar de métricas. También es más susceptible a exageraciones precisamente porque la verificación lleva tanto tiempo.
El patrón es conocido: la afirmación surge con documentación mínima, la atención aumenta, la verificación se retrasa, la resolución (verdadera, parcialmente verdadera o exagerada) llega semanas después con una fracción de la señal original. El bajo engagement en HN aquí es en sí mismo una señal: la comunidad aún no trata esto como establecido.
Sigue el artículo, no el tuit. Si OpenAI publica la metodología y los problemas son verificados formalmente por matemáticos independientes, esto es un hito. Hasta entonces, la fuente es un tuit con 9 puntos en HN. Calibra en consecuencia.
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Inicia sesión para unirte a la conversación.
If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?
I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?
Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.
Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?
I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.
If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.
This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.
But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.
Fatigue hype 2026 : le tri entre modèle et harness