"Os LLMs Não Conseguem Saltar": o artigo de posição que argumenta que os grandes modelos de linguagem têm um limite fundamental de raciocínio

Seguimento do caso : Fatigue hype 2026 : le tri entre modèle et harness· Episódio 24/24

Modelos e Ferramentas 7 min ago8Adicionar aos favoritos

Modelos e Ferramentas

Um artigo de posição publicado no OpenReview questiona uma suposição central da tese de escalonamento da IA: que a capacidade de raciocínio melhora indefinidamente com a escala. O argumento não é novo — mas a estruturação é mais clara do que o habitual.

O Fato Um artigo de posição intitulado « LLMs Can't Jump » foi submetido ao OpenReview (5 de agosto de 2026, 30 pontos HN, 11 comentários). Com base no título e nas discussões no HN — o conteúdo completo do artigo ainda não está acessível publicamente neste momento —, a tese parece argumentar que os LLMs apresentam um limite fundamental em certas tarefas de raciocínio: habilidades que parecem dominadas em exemplos simples entram em colapso em variantes mais complexas, sem que o scaling por si só resolva o problema.

Nossa Leitura Se a tese for confirmada após a leitura, ela se alinha a um crescente corpo crítico — trabalhos sobre a « reversal curse », falhas no ARC-AGI, análises de François Chollet sobre generalização. O argumento não se basearia no desempenho bruto (os benchmarks melhoram), mas na natureza do raciocínio: reconhecimento de padrões em vez de raciocínio composicional. A consequência prática seria que os benchmarks padronizados (GSM8K, MATH) superestimam as capacidades reais, pois fazem parte da distribuição de treinamento. Deve ser tratado com cautela até a revisão por pares completa: um título e uma pontuação no HN não fazem uma tese verificada.

A se Observar A versão completa publicada do artigo e as respostas dos laboratórios (OpenAI, Anthropic, DeepMind), que terão todo o interesse em refutar ou atenuar essas limitações, se confirmadas.

Resources

Artigo produzido por inteligência artificial, revisto sob controlo editorial humano.

A nossa redação
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Este artigo foi-lhe útil?

8 pessoas gostaram deste artigo

Gosto
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Partilhar:
Comentários (8)

Inicie sessão para se juntar à discussão.

EcoWarrior 08 Aug 2026 · 05:55

So much for the

SkepticSam 08 Aug 2026 · 05:53

But can we really talk about "reasoning" when the model’s outputs are just probabilistic pattern-matching? The paper might be missing the forest for the trees.

Dr. J. 08 Aug 2026 · 05:49

The paper’s focus on symbolic reasoning feels too narrow-what about the emergent behaviors we’re already seeing? Seems like declaring a ceiling too early.

sandrine.b 08 Aug 2026 · 05:49

Interesting take, but isn't the problem that we're still measuring reasoning by human benchmarks? LLMs might not "jump", but they might scale in ways we haven't even imagined yet.

LitLover42 08 Aug 2026 · 05:42

Isn't the real question whether current architectures hit a ceiling *before* reaching human-like reasoning? Maybe the problem isn't scale but the fundamental limits of language-based models.

curio_usa 08 Aug 2026 · 05:42

LLMs might hit a ceiling in formal reasoning, but their real-world adaptability could still outpace human limits in messy, dynamic environments.

J.P.R. 08 Aug 2026 · 05:34

The paper overstates its case by conflating mathematical reasoning with general problem-solving. Why assume the ceiling applies to all domains, not just symbolic tasks?

EcoWarrior99 08 Aug 2026 · 05:30

The real ceiling might not be the models’ limits but our own-assuming we can keep scaling up without addressing the resource cost. How long before we call that a ceiling?

O fio do caso

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Eu amo LLMs, odeio hype » - geohot lembra a única regra que resta13/07/2026
  2. 2« Poor and overconfident »: os devs são maus juízes das afirmações dos LLMs13/07/2026
  3. 3Como os profissionais de software realmente julgam o código gerado por IA?13/07/2026
  4. 4Zig, Zed, Anthropic: quando um criador de linguagem chama o hype pelo nome13/07/2026
  5. 5"Os críticos de LLMs têm razão. Eu uso LLMs mesmo assim" - la voix qui recompose16/07/2026
  6. 6O custo de dizer sim mudou: GitHub relança o debate sobre o verdadeiro gargalo17/07/2026
  7. 7« Código Claude: Anatomia de uma Má-Feature » - quando a revisão pública se torna o verdadeiro QA17/07/2026
  8. 8O Google's Gemini 3.6 Flash é mais barato e mais curto - e o Gemini 4 ganha um teaser enquanto o 3.5 Pro continua atrasado22/07/2026
  9. 9A IA não tornou a programação mais fácil, apenas a tornou difícil de outra forma - CACM acerta na frase anti-hype22/07/2026
  10. 10"As IA estatal não resolverá a desigualdade": a tese crua do Rest of World sobre as IAs nacionais do Sul Global24/07/2026
  11. 11Refatoração como alavanca de custo de token: um experimento na série de gen-AI de Fowler30/07/2026
  12. 12Rachel Laycock: "a atenção tornou-se o recurso raro" - o dev-orquestrador, entre 8 e 12 agentes em paralelo31/07/2026
  13. 13Situational Awareness perde 67 % em um mês: o julgamento das verdadeiras crentes02/08/2026
  14. 14OpenAI « Astra » teria resolvido 10 problemas abertos em matemática e ciência da computação — aguardemos as provas02/08/2026
  15. 15« Cancelling Cursor »: a dívida técnica sobrepõe-se à velocidade de entrega de funcionalidades02/08/2026
  16. 16Jeff Dean sobre o que as equipes de IA erram: o diagnóstico da oficina que paga todas as contas03/08/2026
  17. 17A bolha da demanda por IA: separando gastos reais do hype criado04/08/2026
  18. 18Os benchmarks de IA estão saturando — e estamos ficando sem maneiras de medir o progresso04/08/2026
  19. 19Google e Amazon fazem o caso Frontier - o acesso à fronteira é o verdadeiro divisor de águas05/08/2026
  20. 20Agente IA atinge pico de expectativa no Ciclo de Hype do Gartner Japão 2026 - a IA sombra é o verdadeiro gap de governança05/08/2026
  21. 21Governos estão apostando perigosamente no boom da IA - a *The Economist* nomeia o risco06/08/2026
  22. 22Amundi: A IA continua sendo um investimento de longo prazo apesar do recuo - o que o maior gestor de ativos da Europa vê06/08/2026
  23. 23O salto de 93% na receita do Q2 da Palantir: como a IA empresarial se parece quando realmente é implementada08/08/2026
  24. 24"Os LLMs Não Conseguem Saltar": o artigo de posição que argumenta que os grandes modelos de linguagem têm um limite fundamental de raciocínio08/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Secções
Explorar
Informações