OpenAI's модель 'Astra' заявляет о решении 10 открытых математических задач — когда ИИ перестаёт тестироваться и начинает открывать новое

Продолжение истории : Fatigue hype 2026 : le tri entre modèle et harness· Часть 33/33

Модели и инструменты Aug 25, 2026 at 16:277В закладки

OpenAI's модель 'Astra' заявляет о решении 10 открытых математических задач — когда ИИ перестаёт тестироваться и начинает открывать новое
Иллюстрация : Léa Fontaine

Внутренняя модель OpenAI, как сообщается, решила десять открытых проблем в математике и Computer Science. Если это подтвердится, это качественный рубеж: не лучший результат на известном тесте, а новые знания в областях, где эксперты-люди потерпели неудачу. Вопрос проверки — это вся история, и на это уйдут не дни, а недели.

Простыми словами

AI-модели обычно тестируют на задачах с известными ответами. Здесь речь идёт о принципиально другом: по сообщениям, неопубликованная внутренняя модель решила задачи, над которыми безуспешно работали учёные-исследователи. Источник этого утверждения крайне ненадёжен — твит, на который ссылается малоизвестный пост на Hacker News. Именно эта ненадёжность и является частью темы этой статьи.

Само утверждение и его происхождение

Пост на Hacker News (9 очков, 0 комментариев на момент написания) содержит ссылку на твит от @polynoamial, где говорится, что внутренняя модель OpenAI "Astra" решила десять открытых проблем в математике и computer science. У модели внутреннее название "Astra" — оно отличается от Google DeepMind Project Astra и не является публично доступной системой.

Цепочка источников выглядит так: твит → ссылка на Hacker News без обсуждения → наше освещение. Эта цепочка крайне ненадёжна. Причина, по которой это стоит освещать, не в самом утверждении, а в том, что оно представляет собой в меняющемся ландшафте коммуникации возможностей.

Доказательство vs. предполагаемое решение

В объявлениях об ИИ фраза «решено» обычно означает «предложено решение, которое выглядит корректным» — а не «сгенерировано машинно-проверенное формальное доказательство». В формальной математике разрыв огромен. Модель может предложить убедительно выглядящий ответ на открытую проблему, содержащий тонкую ошибку, которую эксперты будут искать неделями. Пока решения не будут формально проверены независимыми математиками, утверждение остаётся неподтверждённым, независимо от того, насколько убедительно звучит модель.

Почему это важно, если это правда — и почему проверка занимает время

Если утверждение подтвердится: это станет пороговым достижением в автоматизированных рассуждениях, которое большинство исследователей считали более отдалённым. Это не просто улучшение бенчмарка — это система ИИ, генерирующая новые математические знания. Последствия для производительности исследований в математике и CS-департаментах будут структурными.

Сроки проверки подлинных открытых проблем — от недель до месяцев. Консенсус математического сообщества по нетривиальному доказательству занимает время даже когда его представляют сами математики. Решение, сгенерированное ИИ, подвергается соответствующей проверке, которую нельзя ускорить.

Следующее поколение утверждений о возможностях

Этот класс утверждений — «мы решили открытые проблемы» вместо «мы улучшили показатели бенчмарков» — сложнее оценить, имеет более высокие ставки и менее подвержен стандартной критике бенчмарков. В то же время он более подвержен преувеличениям именно потому, что проверка занимает так много времени.

Эта схема знакома: утверждение появляется с минимальной документацией, внимание растёт, проверка затягивается, итог (истина, частичная правда или преувеличение) приходит недели спустя с долей от первоначального внимания. Низкая вовлечённость на Hacker News здесь сама по себе сигнал: сообщество пока не воспринимает это как установленный факт.

Что делать

Следите за публикацией, а не за твитом. Если OpenAI опубликует методологию, а проблемы будут формально проверены независимыми математиками, это станет вехой. Пока же источником является твит с 9 очками на Hacker News. Оценивайте соответствующим образом.

Resources

Статья создана искусственным интеллектом и проверена под редакционным контролем человека.

Наша редакция
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
Была ли статья полезной?

7 чел. оценили эту статью

Нравится
P
Priya RamanMachine Learning Engineer
🇬🇧 ML engineer, applied research.
Поделиться:
Комментарии (7)

Войдите, чтобы участвовать в обсуждении.

TechSavvy47 25 Aug 2026 · 13:02

If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?

ArtLoverLA 25 Aug 2026 · 15:15

I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?

MusicFanatic 25 Aug 2026 · 12:46

Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.

sandrine.b 25 Aug 2026 · 12:37

Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?

GreenThumb 25 Aug 2026 · 12:30

I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.

Dr. J. 25 Aug 2026 · 12:25

If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.

Alex 2 25 Aug 2026 · 12:23

This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.

Alex 25 Aug 2026 · 12:12

But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.

Хронология истории

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1« Я люблю LLMs, ненавижу хайп » - geohot напоминает единственное оставшееся правило13/07/2026
  2. 2« Бедные и самонадеянные »: разработчики плохо судят утверждения LLM13/07/2026
  3. 3Как профессионалы в области программного обеспечения действительно оценивают код, сгенерированный ИИ?13/07/2026
  4. 4Zig, Zed, Anthropic: когда творец языка называет хайп своим именем13/07/2026
  5. 5"Критики LLM правы. Но я всё равно использую LLM" — голос, который пересобирает16/07/2026
  6. 6Стоимость слова «да» изменилась: GitHub возвращается к обсуждению настоящего узкого места17/07/2026
  7. 7« Claude Code: Анатомия неудачного решения» — когда публичный обзор становится настоящим QA17/07/2026
  8. 8Google's Gemini 3.6 Flash дешевле и короче — а Gemini 4 получает анонс, в то время как 3.5 Pro остаётся доступным.22/07/2026
  9. 9"ИИ не сделал программирование проще, он просто сделал его по-другому сложным" — CACM преподнесла анти-хайп цитату22/07/2026
  10. 10"Государственный ИИ не решит проблему неравенства": резкая позиция Rest of World об национальных ИИ в странах глобального Юга24/07/2026
  11. 11Рефакторинг как рычаг снижения токен-стоимости: эксперимент в серии Фоулера по генеративному ИИ30/07/2026
  12. 12Рэйчел Лэйкок: «Внимание стало редким ресурсом» — разработчик-оркестратор, работающий с 8–12 агентами одновременно31/07/2026
  13. 13Situational Awareness теряет 67 % за месяц: суд над истинными верующими02/08/2026
  14. 14OpenAI « Astra » предположительно решил 10 открытых задач в математике и Computer Science — ждём доказательств02/08/2026
  15. 15« Отмена курсора»: технический долг берет верх над скоростью разработки новых функций02/08/2026
  16. 16Джефф Дин о том, что команды по ИИ делают не так: диагноз от того, кто платит по всем счетам03/08/2026
  17. 17Искусственный пузырь спроса: разделение реальных расходов и искусственно созданного ажиотажа04/08/2026
  18. 18Бенчмарки ИИ достигают насыщения — и у нас заканчиваются способы измерения прогресса.04/08/2026
  19. 19Google и Amazon's AI earnings делают Frontier Case актуальным — доступ к Frontier является настоящим разделителем05/08/2026
  20. 20Агентный ИИ достигает пика ажиотажа в цикле ажиотажа Gartner Japan 2026 — теневой ИИ становится реальным пробелом в управлении05/08/2026
  21. 21Правительства делают опасную ставку на бум искусственного интеллекта — The Economist называет риски06/08/2026
  22. 22Amundi: ИИ остаётся долгосрочной ставкой несмотря на распродажу — что видит крупнейший в Европе управляющий активами06/08/2026
  23. 23Palantir's 93% рост выручки во 2 квартале: что такое корпоративный ИИ, когда он действительно внедряется08/08/2026
  24. 24"LLM не могут прыгать": аналитическая статья, утверждающая, что у больших языковых моделей есть фундаментальный предел рассуждений08/08/2026
  25. 25Понимание — это архитектурная характеристика, и сгенерированный ИИ код не справляется с ней.13/08/2026
  26. 26TEMU-фикация программного обеспечения: дешёвое, доступное и всё сложнее продавать14/08/2026
  27. 27Почему работать с Opus 5 кажется хуже — и что это говорит об оценке моделей14/08/2026
  28. 28Xiaomi 17 Ultra принял Луну за Солнце — обработка фото с помощью ИИ всё ещё обманывает вас14/08/2026
  29. 29Anthropic's Conceptual Reasoning Index нацелен на проблему загрязнения бенчмарков18/08/2026
  30. 30AI-трейдинг подтолкнул волатильность японских акций до 18-летнего максимума — риск концентрации становится измеримым19/08/2026
  31. 31Экономика создателей и её ИИ-революция: когда жажда денег теряет аудиторию24/08/2026
  32. 32Я становлюсь ИИ-слепым — и это реальная проблема24/08/2026
  33. 33OpenAI's модель 'Astra' заявляет о решении 10 открытых математических задач — когда ИИ перестаёт тестироваться и начинает открывать новое25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
Темы
Обзор
Информация