Модели и инструменты 1 h ago8В закладки
Докладная записка, опубликованная на OpenReview, ставит под сомнение основное предположение о том, что возможности рассуждения улучшаются бесконечно с увеличением масштаба в рамках тезиса о масштабировании ИИ. Этот аргумент не нов — но его формулировка более чёткая, чем обычно.
Факт Статья с заголовком « LLMs Can't Jump» была подана в OpenReview (5 августа 2026 г., 30 баллов на Hacker News, 11 комментариев). На основе заголовка и обсуждений на Hacker News — полный текст статьи пока недоступен публично — в тезисе, похоже, утверждается, что у больших языковых моделей (LLM) есть фундаментальный предел в решении определённых задач на рассуждение: способности, которые проявляются на простых примерах, рушатся на более сложных вариантах, и масштабирование само по себе не решает проблему.
Наше мнение Если тезис подтвердится при прочтении, он впишется в растущий критический корпус — работы о «проклятии обратимости» (reversal curse), неудачи на ARC-AGI, анализы Франсуа Шолле о обобщении. Аргумент касается не общей производительности (бенчмарки улучшаются), а природы рассуждения: распознавание шаблонов вместо композиционного мышления. Практическое следствие — стандартные бенчмарки (GSM8K, MATH) переоценивают реальные возможности, так как они входят в обучающее распределение. К этому стоит относиться с осторожностью до полной рецензии: заголовок и оценка на Hacker News — ещё не проверенный тезис.
На что обратить внимание Полная версия статьи и ответы лабораторий (OpenAI, Anthropic, DeepMind), которые будут заинтересованы опровергнуть или смягчить эти ограничения, если они подтвердятся.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
So much for the
But can we really talk about "reasoning" when the model’s outputs are just probabilistic pattern-matching? The paper might be missing the forest for the trees.
The paper’s focus on symbolic reasoning feels too narrow-what about the emergent behaviors we’re already seeing? Seems like declaring a ceiling too early.
Interesting take, but isn't the problem that we're still measuring reasoning by human benchmarks? LLMs might not "jump", but they might scale in ways we haven't even imagined yet.
Isn't the real question whether current architectures hit a ceiling *before* reaching human-like reasoning? Maybe the problem isn't scale but the fundamental limits of language-based models.
LLMs might hit a ceiling in formal reasoning, but their real-world adaptability could still outpace human limits in messy, dynamic environments.
The paper overstates its case by conflating mathematical reasoning with general problem-solving. Why assume the ceiling applies to all domains, not just symbolic tasks?
The real ceiling might not be the models’ limits but our own-assuming we can keep scaling up without addressing the resource cost. How long before we call that a ceiling?
Fatigue hype 2026 : le tri entre modèle et harness