모델 및 도구 Aug 25, 2026 at 16:277북마크에 추가

AI 내부 모델이 reportedly 수학과 컴퓨터 과학의 열 가지 공개 문제를 해결했다고 합니다. 검증된다면, 이는 질적인 도약입니다: 알려진 테스트에서 더 나은 점수를 받은 것이 아니라, 인간 전문가조차 해결하지 못한 분야에서 새로운 지식을 창출한 것입니다. 검증 과정은 하루 이틀이 아니라 몇 주에 걸쳐 진행될 것입니다.
AI 모델은 보통 알려진 답이 있는 문제로 테스트됩니다. 하지만 여기 주장은 완전히 다릅니다: 아직 공개되지 않은 내부 모델이 인간 연구자들이 해결하지 못한 문제들을 해결했다는 소식입니다. 이 주장의 출처는 매우 빈약합니다. 트윗 하나와 트래픽이 적은 해커뉴스 게시물로 연결된 링크가 전부입니다. 이 빈약함こそ이 글의 주제 중 하나입니다.
해커뉴스 게시물(작성 당시 9점, 0개의 댓글)이 @polynoamial의 트윗을 링크했습니다. 이 트윗은 내부 OpenAI 모델 "Astra"가 수학과 컴퓨터 과학의 열 가지 미해결 문제를 해결했다고 설명합니다. "Astra"는 내부 명칭으로, 구글 딥마인드의 프로젝트 아스트라와는 다르며 공개된 시스템이 아닙니다.
출처 체인: 트윗 → 아무런 논의가 없는 HN 링크 → 우리의 보도. 이 체인은 매우 빈약합니다. 이 주장을 보도할 가치가 있는 이유는 주장 자체 때문이 아니라, 능력 커뮤니케이션이 변화하는 방식의 한 예이기 때문입니다.
'AI 발표에서 '해결했다'는 말은 '정확해 보이는 해결책을 제안했다'는 뜻일 뿐입니다. 이는 '기계로 검증된 공식 증명을 생성했다'는 의미와는 다릅니다. 형식 수학에서 이 차이는 엄청납니다. 모델은 미해결 문제에 convincing해 보이는 답을 제안할 수 있지만, 전문가들이 몇 주를 들여서야 발견할 수 있는 미묘한 결함을 포함할 수 있습니다. 해결책이 독립적인 수학자들에 의해 형식적으로 검증될 때까지는, 모델이 얼마나 유능해 보이든 주장은 확인되지 않은 상태입니다.
독립적으로 검증된다면, 이는 대부분의 연구자들이 더 멀리 두고 있던 자동화 추론의 새로운Threshold가 될 것입니다. 단순히 벤치마크 성능 향상이 아니라, AI 시스템이 새로운 수학적 지식을 생성했다는 의미입니다. 수학과 컴퓨터 과학 부서의 연구 생산성에 미치는 영향은 구조적일 것입니다.
진정한 미해결 문제에 대한 검증 기간은 몇 주에서 몇 달에 이릅니다. 인간 수학자가 제출한 비단순 증명도 합의에 도달하는 데 시간이 걸립니다. AI가 생성한 해결책은 적절한 검증을 받아야 하며, 이를 단축할 수 없습니다.
이 유형의 주장—'우리는 미해결 문제를 해결했다'는 '우리는 벤치마크 점수를 개선했다'는—은 평가하기 더 어렵고, stakes가 높으며, 표준 벤치마크 비판에 면역이 있습니다. 또한 검증이 너무 오래 걸려서 precisely하게 과장될 가능성이 더 높습니다.
이 패턴은 익숙합니다: 주장이 최소한의 문서와 함께 표면화되고, 관심은 급등하며, 검증은 지연되고, 몇 주 후에야 진실(사실, 부분적 사실, 과장된 주장)으로 결론이 납니다. 여기 해커뉴스의 낮은 참여도 그 자체로 신호입니다: 커뮤니티가 아직 이 주장을 확립된 사실로 여기지 않는다는 뜻입니다.
트윗이 아니라 논문을 따라가세요. OpenAI가 방법론을 발표하고, 문제들이 독립적인 수학자들에 의해 형식적으로 검증된다면, 이는 획기적인 사건입니다. 그때까지는 이 주장의 출처는 9점의 HN 게시물에 불과합니다. accordingly하게 판단하세요.
인공지능이 작성하고 사람의 편집 감독하에 검수한 기사입니다.
If this holds up, it's not just a leap for AI but a serious challenge to how we verify scientific progress. What does peer review look like when the algorithm does the discovering, not the human?
I wonder if the real shift isn’t just in discovery but in how we train reviewers to understand AI’s method-what if peer review becomes a collaboration instead of a gatekeeping step?
Fascinating, but why stop at ten? If AI can crack these open problems, why not target unsolved conjectures like P vs NP or the Riemann Hypothesis next? True discovery should be iterative, not isolated.
Exciting if true, but worrying if these 'discoveries' stem from data contamination rather than genuine insight. How can we trust outputs when transparency is optional?
I’d love to see peer review confirm this-novelty claims without open data feel like a black box. But even if proven, it’s exciting to think AI could spark ideas humans missed.
If even a fraction of these claims hold up, it’s a seismic shift in how we see AI’s role in science-not just a tool, but a collaborator. But until the methods and data are fully audited, it’s still just a tantalizing rumor.
This is genuinely impressive-AI finally contributing new knowledge rather than just optimizing benchmarks is a game changer. Wonder if peer review will catch up or if we’ll have to adjust trust in automated proofs entirely.
But how do we know these solutions weren’t already in the training data? Without full transparency, skepticism about novelty is inevitable.
Fatigue hype 2026 : le tri entre modèle et harness