O modelo 'Astra' da OpenAI alega ter resolvido 10 problemas matemáticos abertos - Quando a IA para de avaliar e começa a descobrir

Seguimento do caso : Fatigue hype 2026 : le tri entre modèle et harness· Episódio 33/33

Modelos e Ferramentas Aug 25, 2026 at 16:277Adicionar aos favoritos

O modelo 'Astra' da OpenAI alega ter resolvido 10 problemas matemáticos abertos - Quando a IA para de avaliar e começa a descobrir
Ilustração : Léa Fontaine

Um modelo interno da OpenAI teria resolvido dez problemas em aberto em matemática e ciência da computação. Se verificado, trata-se de um marco qualitativo: não uma pontuação melhor em um teste conhecido, mas conhecimento novo em domínios onde especialistas humanos não haviam obtido sucesso. A questão da verificação é toda a história — e levará semanas, não dias.

Em termos simples

Os modelos de IA geralmente são testados em problemas com respostas conhecidas. A alegação aqui é categoricamente diferente: um modelo interno não lançado, segundo relatos, resolveu problemas que pesquisadores humanos ainda não haviam conseguido. A origem dessa alegação é frágil — um tuíte, compartilhado em uma postagem de baixa repercussão no Hacker News. Essa fragilidade faz parte do que este texto aborda.

A alegação e sua origem

Uma postagem no Hacker News (9 pontos, 0 comentários no momento da escrita) vincula um tuíte de @polynoamial descrevendo um modelo interno da OpenAI que teria resolvido dez problemas em aberto em matemática e ciência da computação. O modelo tem o nome interno "Astra" — distinto do Project Astra do Google DeepMind e não é um sistema público.

Esta é a cadeia de origem: tuíte → link no HN sem discussão → nossa cobertura. Essa cadeia é frágil. O motivo pelo qual vale a pena cobrir não é a alegação em si — é o que essa classe de alegação representa em relação à mudança na comunicação de capacidades.

Prova vs. solução proposta

'Resolvido' em anúncios de IA geralmente significa 'propôs uma solução que parece correta' — não 'produziu uma prova formal verificada por máquina.' A lacuna é enorme na matemática formal. Um modelo pode propor uma resposta convincente para um problema em aberto que contenha um defeito sutil, que especialistas levam semanas para encontrar. Até que as soluções sejam formalmente verificadas por matemáticos independentes, a alegação permanece não confirmada, independentemente de quão capaz o modelo pareça.

Por que isso importa, se for real — e por que a verificação leva tempo

Se for verificada de forma independente: isso representaria um marco no raciocínio automatizado que a maioria dos pesquisadores considerava mais distante. Não apenas mais uma melhora em benchmarks — um sistema de IA que gera novo conhecimento matemático. As implicações para a produtividade de pesquisa em departamentos de matemática e ciência da computação seriam estruturais.

O cronograma de verificação para problemas realmente em aberto é de semanas a meses. O consenso da comunidade matemática sobre uma prova não trivial leva tempo mesmo quando matemáticos humanos a apresentam. Uma solução gerada por IA enfrenta o devido escrutínio, que não pode ser abreviado.

A próxima geração de alegações de capacidade

Essa classe de alegação — "nós resolvemos problemas em aberto" em vez de "melhoramos pontuações em benchmarks" — é mais difícil de avaliar, tem maiores riscos e é mais imune às críticas padrão de benchmarks. Também é mais suscetível a exageros justamente porque a verificação leva tanto tempo.

O padrão é conhecido: a alegação surge com documentação mínima, a atenção aumenta, a verificação se arrasta e a resolução (verdadeira, parcialmente verdadeira ou exagerada) chega semanas depois, com uma fração do sinal original. O baixo engajamento no HN aqui é, em si, um sinal: a comunidade ainda não trata isso como estabelecido.

Então, o que fazer?

Acompanhe o artigo, não o tuíte. Se a OpenAI publicar a metodologia e os problemas forem formalmente verificados por matemáticos independentes, isso será um marco. Até lá, a origem é um tuíte com 9 pontos no HN. Aja de acordo.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

7 pessoas gostaram deste artigo

Gosto
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Partilhar:
Comentários (7)

Inicie sessão para se juntar à discussão.

TechSavvy47 25 Aug 2026 · 13:02

If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?

ArtLoverLA 25 Aug 2026 · 15:15

I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?

MusicFanatic 25 Aug 2026 · 12:46

Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.

sandrine.b 25 Aug 2026 · 12:37

Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?

GreenThumb 25 Aug 2026 · 12:30

I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.

Dr. J. 25 Aug 2026 · 12:25

If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.

Alex 2 25 Aug 2026 · 12:23

This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.

Alex 25 Aug 2026 · 12:12

But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.

O fio do caso

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Eu amo LLMs, odeio hype » - geohot lembra a única regra que resta13/07/2026
  2. 2« Poor and overconfident »: os devs são maus juízes das afirmações dos LLMs13/07/2026
  3. 3Como os profissionais de software realmente julgam o código gerado por IA?13/07/2026
  4. 4Zig, Zed, Anthropic: quando um criador de linguagem chama o hype pelo nome13/07/2026
  5. 5"Os críticos de LLMs têm razão. Eu uso LLMs mesmo assim" - la voix qui recompose16/07/2026
  6. 6O custo de dizer sim mudou: GitHub relança o debate sobre o verdadeiro gargalo17/07/2026
  7. 7« Código Claude: Anatomia de uma Má-Feature » - quando a revisão pública se torna o verdadeiro QA17/07/2026
  8. 8O Google's Gemini 3.6 Flash é mais barato e mais curto - e o Gemini 4 ganha um teaser enquanto o 3.5 Pro continua atrasado22/07/2026
  9. 9A IA não tornou a programação mais fácil, apenas a tornou difícil de outra forma - CACM acerta na frase anti-hype22/07/2026
  10. 10"As IA estatal não resolverá a desigualdade": a tese crua do Rest of World sobre as IAs nacionais do Sul Global24/07/2026
  11. 11Refatoração como alavanca de custo de token: um experimento na série de gen-AI de Fowler30/07/2026
  12. 12Rachel Laycock: "a atenção tornou-se o recurso raro" - o dev-orquestrador, entre 8 e 12 agentes em paralelo31/07/2026
  13. 13Situational Awareness perde 67 % em um mês: o julgamento das verdadeiras crentes02/08/2026
  14. 14OpenAI « Astra » teria resolvido 10 problemas abertos em matemática e ciência da computação — aguardemos as provas02/08/2026
  15. 15« Cancelling Cursor »: a dívida técnica sobrepõe-se à velocidade de entrega de funcionalidades02/08/2026
  16. 16Jeff Dean sobre o que as equipes de IA erram: o diagnóstico da oficina que paga todas as contas03/08/2026
  17. 17A bolha da demanda por IA: separando gastos reais do hype criado04/08/2026
  18. 18Os benchmarks de IA estão saturando — e estamos ficando sem maneiras de medir o progresso04/08/2026
  19. 19Google e Amazon fazem o caso Frontier - o acesso à fronteira é o verdadeiro divisor de águas05/08/2026
  20. 20Agente IA atinge pico de expectativa no Ciclo de Hype do Gartner Japão 2026 - a IA sombra é o verdadeiro gap de governança05/08/2026
  21. 21Governos estão apostando perigosamente no boom da IA - a *The Economist* nomeia o risco06/08/2026
  22. 22Amundi: A IA continua sendo um investimento de longo prazo apesar do recuo - o que o maior gestor de ativos da Europa vê06/08/2026
  23. 23O salto de 93% na receita do Q2 da Palantir: como a IA empresarial se parece quando realmente é implementada08/08/2026
  24. 24"Os LLMs Não Conseguem Saltar": o artigo de posição que argumenta que os grandes modelos de linguagem têm um limite fundamental de raciocínio08/08/2026
  25. 25A compreensão é uma característica arquitetural — e o código gerado por IA está falhando nela.13/08/2026
  26. 26A TEMU-ficação do software: barato, abundante e cada vez mais difícil de vender14/08/2026
  27. 27Por que o Opus 5 parece pior para trabalhar - e o que isso diz sobre a avaliação de modelos14/08/2026
  28. 28O Xiaomi 17 Ultra confundiu a Lua com o Sol - o processamento de fotos com IA ainda está te enganando14/08/2026
  29. 29O Índice de Raciocínio Conceitual da Anthropic aborda o problema de contaminação de benchmarks18/08/2026
  30. 30IA negociações impulsionam volatilidade das ações no Japão a máxima de 18 anos - o risco de concentração torna-se mensurável19/08/2026
  31. 31A Reviravolta da IA na Economia Criativa: Quando Aceitar o Dinheiro Perde o Público24/08/2026
  32. 32Estou a Tornar-me Cego à IA — e Isso é um Problema Real24/08/2026
  33. 33O modelo 'Astra' da OpenAI alega ter resolvido 10 problemas matemáticos abertos - Quando a IA para de avaliar e começa a descobrir25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações