"LLM не могут прыгать": аналитическая статья, утверждающая, что у больших языковых моделей есть фундаментальный предел рассуждений

Продолжение истории : Fatigue hype 2026 : le tri entre modèle et harness· Часть 24/24

Модели и инструменты just now8В закладки

Модели и инструменты

Докладная записка, опубликованная на OpenReview, ставит под сомнение основное предположение о том, что возможности рассуждения улучшаются бесконечно с увеличением масштаба в рамках тезиса о масштабировании ИИ. Этот аргумент не нов — но его формулировка более чёткая, чем обычно.

Факт Статья с заголовком « LLMs Can't Jump» была подана в OpenReview (5 августа 2026 г., 30 баллов на Hacker News, 11 комментариев). На основе заголовка и обсуждений на Hacker News — полный текст статьи пока недоступен публично — в тезисе, похоже, утверждается, что у больших языковых моделей (LLM) есть фундаментальный предел в решении определённых задач на рассуждение: способности, которые проявляются на простых примерах, рушатся на более сложных вариантах, и масштабирование само по себе не решает проблему.

Наше мнение Если тезис подтвердится при прочтении, он впишется в растущий критический корпус — работы о «проклятии обратимости» (reversal curse), неудачи на ARC-AGI, анализы Франсуа Шолле о обобщении. Аргумент касается не общей производительности (бенчмарки улучшаются), а природы рассуждения: распознавание шаблонов вместо композиционного мышления. Практическое следствие — стандартные бенчмарки (GSM8K, MATH) переоценивают реальные возможности, так как они входят в обучающее распределение. К этому стоит относиться с осторожностью до полной рецензии: заголовок и оценка на Hacker News — ещё не проверенный тезис.

На что обратить внимание Полная версия статьи и ответы лабораторий (OpenAI, Anthropic, DeepMind), которые будут заинтересованы опровергнуть или смягчить эти ограничения, если они подтвердятся.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

8 чел. оценили эту статью

Нравится
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Поделиться:
Комментарии (8)

Войдите, чтобы участвовать в обсуждении.

EcoWarrior 08 Aug 2026 · 05:55

So much for the

SkepticSam 08 Aug 2026 · 05:53

But can we really talk about "reasoning" when the model’s outputs are just probabilistic pattern-matching? The paper might be missing the forest for the trees.

Dr. J. 08 Aug 2026 · 05:49

The paper’s focus on symbolic reasoning feels too narrow-what about the emergent behaviors we’re already seeing? Seems like declaring a ceiling too early.

sandrine.b 08 Aug 2026 · 05:49

Interesting take, but isn't the problem that we're still measuring reasoning by human benchmarks? LLMs might not "jump", but they might scale in ways we haven't even imagined yet.

LitLover42 08 Aug 2026 · 05:42

Isn't the real question whether current architectures hit a ceiling *before* reaching human-like reasoning? Maybe the problem isn't scale but the fundamental limits of language-based models.

curio_usa 08 Aug 2026 · 05:42

LLMs might hit a ceiling in formal reasoning, but their real-world adaptability could still outpace human limits in messy, dynamic environments.

J.P.R. 08 Aug 2026 · 05:34

The paper overstates its case by conflating mathematical reasoning with general problem-solving. Why assume the ceiling applies to all domains, not just symbolic tasks?

EcoWarrior99 08 Aug 2026 · 05:30

The real ceiling might not be the models’ limits but our own-assuming we can keep scaling up without addressing the resource cost. How long before we call that a ceiling?

Хронология истории

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Я люблю LLMs, ненавижу хайп » - geohot напоминает единственное оставшееся правило13/07/2026
  2. 2« Бедные и самонадеянные »: разработчики плохо судят утверждения LLM13/07/2026
  3. 3Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?13/07/2026
  4. 4Zig, Zed, Anthropic: когда творец языка называет хайп своим именем13/07/2026
  5. 5"Критики LLM правы. Но я всё равно использую LLM" — голос, который пересобирает16/07/2026
  6. 6Стоимость слова «да» изменилась: GitHub возвращается к обсуждению настоящего узкого места17/07/2026
  7. 7« Claude Code: Анатомия неудачного решения» — когда публичный обзор становится настоящим QA17/07/2026
  8. 8Google's Gemini 3.6 Flash дешевле и короче — а Gemini 4 получает анонс, в то время как 3.5 Pro остаётся доступным.22/07/2026
  9. 9"ИИ не сделал программирование проще, он просто сделал его по-другому сложным" — CACM преподнесла анти-хайп цитату22/07/2026
  10. 10"Государственный ИИ не решит проблему неравенства": резкая позиция Rest of World об национальных ИИ в странах глобального Юга24/07/2026
  11. 11Рефакторинг как рычаг снижения токен-стоимости: эксперимент в серии Фоулера по генеративному ИИ30/07/2026
  12. 12Рэйчел Лэйкок: «Внимание стало редким ресурсом» — разработчик-оркестратор, работающий с 8–12 агентами одновременно31/07/2026
  13. 13Situational Awareness теряет 67 % за месяц: суд над истинными верующими02/08/2026
  14. 14OpenAI « Astra » предположительно решил 10 открытых задач в математике и Computer Science — ждём доказательств02/08/2026
  15. 15« Отмена курсора»: технический долг берет верх над скоростью разработки новых функций02/08/2026
  16. 16Джефф Дин о том, что команды по ИИ делают не так: диагноз от того, кто платит по всем счетам03/08/2026
  17. 17Искусственный пузырь спроса: разделение реальных расходов и искусственно созданного ажиотажа04/08/2026
  18. 18Бенчмарки ИИ достигают насыщения — и у нас заканчиваются способы измерения прогресса.04/08/2026
  19. 19Google и Amazon's AI earnings делают Frontier Case актуальным — доступ к Frontier является настоящим разделителем05/08/2026
  20. 20Агентный ИИ достигает пика ажиотажа в цикле ажиотажа Gartner Japan 2026 — теневой ИИ становится реальным пробелом в управлении05/08/2026
  21. 21Правительства делают опасную ставку на бум искусственного интеллекта — The Economist называет риски06/08/2026
  22. 22Amundi: ИИ остаётся долгосрочной ставкой несмотря на распродажу — что видит крупнейший в Европе управляющий активами06/08/2026
  23. 23Palantir's 93% рост выручки во 2 квартале: что такое корпоративный ИИ, когда он действительно внедряется08/08/2026
  24. 24"LLM не могут прыгать": аналитическая статья, утверждающая, что у больших языковых моделей есть фундаментальный предел рассуждений08/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация