Модели и инструменты Aug 25, 2026 at 16:277В закладки

Внутренняя модель OpenAI, как сообщается, решила десять открытых проблем в математике и Computer Science. Если это подтвердится, это качественный рубеж: не лучший результат на известном тесте, а новые знания в областях, где эксперты-люди потерпели неудачу. Вопрос проверки — это вся история, и на это уйдут не дни, а недели.
AI-модели обычно тестируют на задачах с известными ответами. Здесь речь идёт о принципиально другом: по сообщениям, неопубликованная внутренняя модель решила задачи, над которыми безуспешно работали учёные-исследователи. Источник этого утверждения крайне ненадёжен — твит, на который ссылается малоизвестный пост на Hacker News. Именно эта ненадёжность и является частью темы этой статьи.
Пост на Hacker News (9 очков, 0 комментариев на момент написания) содержит ссылку на твит от @polynoamial, где говорится, что внутренняя модель OpenAI "Astra" решила десять открытых проблем в математике и computer science. У модели внутреннее название "Astra" — оно отличается от Google DeepMind Project Astra и не является публично доступной системой.
Цепочка источников выглядит так: твит → ссылка на Hacker News без обсуждения → наше освещение. Эта цепочка крайне ненадёжна. Причина, по которой это стоит освещать, не в самом утверждении, а в том, что оно представляет собой в меняющемся ландшафте коммуникации возможностей.
В объявлениях об ИИ фраза «решено» обычно означает «предложено решение, которое выглядит корректным» — а не «сгенерировано машинно-проверенное формальное доказательство». В формальной математике разрыв огромен. Модель может предложить убедительно выглядящий ответ на открытую проблему, содержащий тонкую ошибку, которую эксперты будут искать неделями. Пока решения не будут формально проверены независимыми математиками, утверждение остаётся неподтверждённым, независимо от того, насколько убедительно звучит модель.
Если утверждение подтвердится: это станет пороговым достижением в автоматизированных рассуждениях, которое большинство исследователей считали более отдалённым. Это не просто улучшение бенчмарка — это система ИИ, генерирующая новые математические знания. Последствия для производительности исследований в математике и CS-департаментах будут структурными.
Сроки проверки подлинных открытых проблем — от недель до месяцев. Консенсус математического сообщества по нетривиальному доказательству занимает время даже когда его представляют сами математики. Решение, сгенерированное ИИ, подвергается соответствующей проверке, которую нельзя ускорить.
Этот класс утверждений — «мы решили открытые проблемы» вместо «мы улучшили показатели бенчмарков» — сложнее оценить, имеет более высокие ставки и менее подвержен стандартной критике бенчмарков. В то же время он более подвержен преувеличениям именно потому, что проверка занимает так много времени.
Эта схема знакома: утверждение появляется с минимальной документацией, внимание растёт, проверка затягивается, итог (истина, частичная правда или преувеличение) приходит недели спустя с долей от первоначального внимания. Низкая вовлечённость на Hacker News здесь сама по себе сигнал: сообщество пока не воспринимает это как установленный факт.
Следите за публикацией, а не за твитом. Если OpenAI опубликует методологию, а проблемы будут формально проверены независимыми математиками, это станет вехой. Пока же источником является твит с 9 очками на Hacker News. Оценивайте соответствующим образом.
Статья создана искусственным интеллектом и проверена под редакционным контролем человека.
Войдите, чтобы участвовать в обсуждении.
If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?
I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?
Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.
Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?
I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.
If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.
This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.
But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.
Fatigue hype 2026 : le tri entre modèle et harness