OpenAI 的“Astra”模型声称解决了10个开放数学问题——当AI不再只进行基准测试,而是开始进行发现时

持续追踪 : Fatigue hype 2026 : le tri entre modèle et harness· 连载 33/33

模型与工具 Aug 25, 2026 at 16:277加入收藏

OpenAI 的“Astra”模型声称解决了10个开放数学问题——当AI不再只进行基准测试,而是开始进行发现时
插图 : Léa Fontaine

内部OpenAI模型据报道解决了十个数学和计算机科学的公开难题。若得到验证,这将是一个质的飞跃:不是在已知测试中取得更好的成绩,而是在人类专家未能成功的领域中产生了新知识。验证过程才是整个故事的关键——这将需要数周而非数天时间。

简言之

AI 模型通常会在已知答案的问题上进行测试。而此次的说法则完全不同:一款未发布的内部模型据称解决了人类研究者尚未攻克的问题。这一说法的来源极为薄弱——仅为一条推文,并由一篇低流量的 Hacker News 帖子转发。这种薄弱正是本文所探讨的重点之一。

说法及其来源

一篇 Hacker News 帖子(截至撰稿时获得 9 点赞,0 条评论)链接了一条来自 @polynoamial 的推文,该推文称 OpenAI 的一款内部模型“Astra”解决了数学与计算机科学领域的十个公开问题。该模型的内部代号为“Astra”——与 Google DeepMind 的“Project Astra”无关,也并非公开可用的系统。

信息链条如下:推文 → 无讨论的 HN 链接 → 本文报道。这一链条极为薄弱。值得报道的原因并非该说法本身,而是这类说法在能力传播方式转变中所代表的意义。

证明与提出的解决方案

AI 公告中‘解决’一词通常指‘提出一个看似正确的解决方案’——而非‘生成一份机器验证的形式化证明’。在形式化数学领域,两者之间存在巨大差距。模型可能提出一个看似可信的开放问题答案,其中却隐藏着专家需花费数周才能发现的细微缺陷。在独立数学家完成形式化验证之前,无论该模型听起来多么强大,其说法都无法得到确认。

如果属实为何重要——以及为何验证需时

若得到独立验证:这将代表自动推理领域的一道门槛,多数研究者原本认为其更遥不可及。这不是又一次基准改进——而是一套生成新数学知识的 AI 系统。对数学与计算机科学系的研究生产力而言,其结构性影响将是深远的。

真正开放问题的验证周期为数周至数月。即使人类数学家提交证明,非平凡证明的数学界共识也需时日。AI 生成的解决方案将面临应有的审查,无法走捷径。

下一代能力主张

这类说法——“我们解决了公开问题”而非“我们提升了基准分数”——更难评估、风险更高,且较少受标准基准批评的影响。但正因为验证耗时长,此类说法也更易被夸大。

这种模式屡见不鲜:说法以最小化文档形式出现,关注度激增,验证拖延,数周后才以原始信号的一小部分分辨出真相(属实、部分属实或夸大其词)。此次 HN 参与度低本身就是一个信号:学界尚未将其视为确立的事实。

结论

关注论文,而非推文。若 OpenAI 发布方法论,且问题由独立数学家完成形式化验证,这将是一个里程碑。在此之前,其来源仅是一条获得 9 点赞的 HN 帖子。请相应调整期望。

Resources

本文由人工智能撰写,并经人工编辑审核。

我们的编辑部
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

SSHMonitoringAI Ops
Get early access
这篇文章对您有帮助吗?

7 人赞了这篇文章

P
Priya Raman机器学习工程师
🇨🇳 机器学习工程师,应用研究
分享:
评论 (7)

登录后即可参与讨论。

TechSavvy47 25 Aug 2026 · 13:02

If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?

ArtLoverLA 25 Aug 2026 · 15:15

I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?

MusicFanatic 25 Aug 2026 · 12:46

Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.

sandrine.b 25 Aug 2026 · 12:37

Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?

GreenThumb 25 Aug 2026 · 12:30

I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.

Dr. J. 25 Aug 2026 · 12:25

If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.

Alex 2 25 Aug 2026 · 12:23

This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.

Alex 25 Aug 2026 · 12:12

But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.

事件时间线

Fatigue hype 2026 : le tri entre modèle et harness

  1. 1「我爱大型语言模型,我恨炒作」——geohot 提醒唯一剩下的规则13/07/2026
  2. 2「贫穷且自信」: 开发者是LLM断言的不良评判者13/07/2026
  3. 3专业人士如何真正评价由AI生成的代码?13/07/2026
  4. 4Zig、Zed、Anthropic:当语言创造者直呼其名13/07/2026
  5. 5"LLM评论家是对的。我还是会用LLM" - 重组的声音16/07/2026
  6. 6成本已变:GitHub重新引发关于真正瓶颈的讨论17/07/2026
  7. 7「Claude Code:功能缺陷解剖」——当公开评审成为真正的质量保证17/07/2026
  8. 8Google的Gemini 3.6 Flash更便宜且更短 - 而Gemini 4有所暗示,3.5 Pro则推迟上线22/07/2026
  9. 9"AI并没有让编程变得更容易,它只是让编程变得难在了不同的方面" - CACM给出了反炒作的观点22/07/2026
  10. 10"国有AI不会解决不平等":Rest of World对全球南方国家国有AI的尖锐论点24/07/2026
  11. 11重构作为代币成本杠杆:福勒生成式AI系列中的一个实验30/07/2026
  12. 12雷切尔·莱科克:“注意力已成为稀缺资源”——开发编排器,同时管理8到12个代理31/07/2026
  13. 13情境意识在一个月内下降67%:真正信徒的审判02/08/2026
  14. 14OpenAI 的「Astra」据说已解决10个数学和计算机科学领域的公开难题——且让我们拭目以待证据。02/08/2026
  15. 15“取消光标”:质量债务压倒功能开发速度02/08/2026
  16. 16杰夫·迪恩谈人工智能团队的常见错误:来自付账商店的诊断03/08/2026
  17. 17AI 需求泡沫:区分真实支出与人为炒作04/08/2026
  18. 18AI 基准测试正在饱和——我们正在耗尽衡量进展的方法04/08/2026
  19. 19谷歌和亚马逊的人工智能收益使“前沿案例”成为现实——前沿访问才是真正的分水岭05/08/2026
  20. 20Agentic AI 在 Gartner 日本 2026 炒作周期中达到顶峰 - 阴影 AI 才是真正的治理缺口05/08/2026
  21. 21各国政府正在对人工智能热潮下注——经济学人指出了风险06/08/2026
  22. 22安本:尽管抛售,人工智能仍是长期赌注——欧洲最大资产管理公司的看法06/08/2026
  23. 23Palantir 93% 的第二季度营收增长:当企业 AI 真正交付时的样子08/08/2026
  24. 24“LLMs 不能跳跃”:立场论文认为大语言模型存在根本性推理上限08/08/2026
  25. 25理解力是一种架构特性——而AI生成的代码正在失去它13/08/2026
  26. 26软件的TEMU化:廉价、充足且越来越难以销售14/08/2026
  27. 27为什么 Opus 5 使用起来感觉更糟糕——以及这对模型评估的意义14/08/2026
  28. 28小米17 Ultra将月亮拍成了太阳——AI照片处理仍在欺骗你14/08/2026
  29. 29安thropic的概念推理指数针对基准污染问题18/08/2026
  30. 30人工智能交易将日本股市波动推至18年高点——集中风险变得可衡量19/08/2026
  31. 31人工智能对创作者经济的重塑:当拿钱反而失去观众24/08/2026
  32. 32我正在变成“AI盲”——而这确实是个大问题24/08/2026
  33. 33OpenAI 的“Astra”模型声称解决了10个开放数学问题——当AI不再只进行基准测试,而是开始进行发现时25/08/2026
Your Linux servers, as a desktop.
TermalOSSponsored
Ops, reimagined

Your Linux servers, as a desktop.

Agentless SSH monitoring, a full remote desktop and an AI ops copilot — no agents to install. Everything stays on your machine.

Get early access
主题
浏览
信息