ArticleRussell Brandom·2026년 8월 11일·0

An unreleased Anthropic model made progress on one of math's biggest unsolved problems

Quick Summary

Anthropic의 미공개 모델은 리만 가설의 일반 증명에는 이르지 못했지만, 60개 하위 에이전트의 대규모 탐색과 검증을 통해 가설이 성립하는 해의 범위에 관한 하한을 크게 높였다.

An unreleased Anthropic model made progress on one of math's biggest unsolved problems 관련 대표 이미지

🖼️ 인포그래픽

An unreleased Anthropic model made progress on one of math's biggest unsolved problems 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

An unreleased Anthropic model made progress on one of math's biggest unsolved problems의 핵심 내용을 4단계로 요약한 인포그래픽
An unreleased Anthropic model made progress on one of math's biggest unsolved problems 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic의 미공개 모델은 리만 가설의 일반 증명에는 이르지 못했지만, 60개 하위 에이전트의 대규모 탐색과 검증을 통해 가설이 성립하는 해의 범위에 관한 하한을 크게 높였다.

📌 핵심 요약

  • 소수의 분포와 관련된 리만 가설은 150년 넘게 풀리지 않았으며, 유효한 일반 증명에는 현재 100만 달러의 상금이 걸려 있다.
  • Anthropic의 미공개 모델은 리만 가설을 완전히 증명하지는 못했지만, 가설이 성립하는 해의 범위에 관한 하한을 유의미하게 높였다.
  • 상당한 수학 훈련이 없던 Anthropic 직원이 모델에 증명을 시도하도록 지시한 뒤, 모델은 약 하루 반 동안 과제를 조율하며 650개의 아이디어를 시험했다.
  • 탐색에는 60개 하위 에이전트와 총 3,100만 출력 토큰이 투입됐으며, 이 가운데 2개가 핵심 수학 아이디어를 개발했다.
  • 성과는 Anthropic 사내 수학자 2명이 확인하고 오픈소스 증명 보조기 Lean으로 형식화했지만, AI 수학 성과의 저자 귀속과 정확성 책임을 둘러싼 논쟁은 계속되고 있다.

🧩 주요 포인트

  1. 개 하위 에이전트 중 핵심 아이디어를 만든 것은 2개였고 나머지는 지원·실패 탐색·검증·논문 작성으로 역할이 나뉘었다는 점은, 수학 연구에서 병렬 탐색과 선별 구조의 중요성을 보여준다.
  2. Anthropic 사내 수학자 2명의 확인과 Lean 형식화가 함께 사용됐다는 점은, AI가 만든 수학적 진전을 인정하려면 인간 검토와 형식 검증이 핵심 절차가 된다는 의미를 갖는다.
  3. 리만 가설의 제한적 진전과 다른 LLM 수학 성과가 이어지는 가운데 저자 귀속과 책임 문제가 제기됐다는 점은, 논쟁의 초점이 성능뿐 아니라 수학 연구의 규범으로 확대되고 있음을 보여준다.

🧠 상세 정리

1. 리만 가설의 위상과 이번 성과의 범위

리만 가설은 소수의 분포와 관련된 수학 문제로, 150년 넘게 주요 미해결 문제로 남아 있다. 이 가설의 유효한 일반 증명을 제시하는 사람에게는 100만 달러의 상금이 걸려 있지만 아직 주인은 나타나지 않았다. 현대 AI 모델 역시 리만 가설 전체를 증명하지 못하며, 이번 Anthropic 모델의 결과도 완전한 해결책은 아니다. 모델이 달성한 것은 기사가 표현한 대로 가설이 성립하는 해의 범위에 관한 하한을 크게 높인 것이다. 따라서 이번 결과는 리만 가설의 종결이 아니라, AI가 난도가 매우 높은 수학 문제에서 기존보다 실질적으로 더 멀리 탐색할 수 있음을 보여준 제한적이지만 중요한 진전이다.

2. 하루 반 동안 진행된 대규모 탐색

성과가 나온 과정은 전문 수학자가 세부 전략을 계속 지시하는 방식과 달랐다. 상당한 수학 훈련이 없던 Anthropic 직원이 미공개 모델에 리만 가설의 증명을 본격적으로 시도해 보라고 요청한 뒤, 모델이 이후 약 하루 반 동안 작업을 조율하도록 두었다. 이 기간에 모델은 문제 해결을 위한 서로 다른 아이디어 650개를 시험했다. 탐색에는 60개 하위 에이전트가 참여했고, 전체 출력량은 3,100만 토큰에 달했다. 즉, 이번 결과는 한 번의 응답에서 나온 단일 풀이가 아니라 여러 접근법을 병렬로 만들고 평가하며 결합한 장시간의 다중 에이전트 연구 과정에서 나왔다.

3. 60개 하위 에이전트의 역할 분담

논문 각주에 따르면 60개 하위 에이전트 가운데 핵심 수학 아이디어를 실제로 발전시킨 것은 2개였다. 다른 13개는 이 핵심 에이전트들에 아이디어를 제공했고, 30개는 새로운 아이디어 개발을 시도했으나 성공하지 못했다. 별도의 13개는 논증의 정확성을 확인하는 검증자 역할을 담당했다. 마지막 2개는 초기 논문 작성에 기여해, 아이디어 탐색부터 결과 정리까지 작업이 단계별로 분리됐음을 보여줬다. 이러한 분포는 모든 에이전트가 동일한 성과를 낸 것이 아니라, 다수의 실패와 지원 작업을 거쳐 소수의 핵심 아이디어를 발견하고 다시 다수의 검증으로 확인하는 구조였다는 사실을 드러낸다.

4. 인간 검토와 Lean 형식화

모델이 도출한 결과는 Anthropic 사내 수학자 2명이 확인했다. 이어 해당 논증은 오픈소스 증명 보조기 Lean을 이용해 형식화됐다. 기사에서 제시된 검증 과정은 모델의 자연어 주장만을 그대로 받아들이지 않고, 수학자의 검토와 형식적 표현을 함께 적용했다는 데 의미가 있다. 특히 13개 하위 에이전트도 논증의 정확성을 점검하는 검증자 역할을 맡았으므로, 검증은 모델 내부의 역할 분담과 외부의 인간·도구 확인을 거쳐 이뤄졌다. 다만 이러한 확인과 형식화는 보고된 진전의 정확성을 뒷받침하는 것이며, 리만 가설의 일반 증명이 완성됐다는 뜻은 아니다.

5. 이어지는 LLM 수학 성과

이번 결과는 대규모 언어 모델이 이끈 일련의 수학 성과 가운데 최신 사례로 소개됐다. 기사에 따르면 올해 여러 Erdos 문제가 AI 모델로 해결됐으며, 더 강력한 모델이 등장하면서 결과도 더욱 인상적으로 변하고 있다. OpenAI는 내부 모델 Astra가 증명한 주요 결과 10개를 최근 공개했다. Anthropic의 별도 연구에서는 오랫동안 유지돼 온 야코비안 추측을 반증하는 결과도 나왔다. 리만 가설 사례를 이 흐름과 함께 보면 AI의 수학적 기여가 하나의 고립된 시연에 머무르지 않고 여러 문제와 모델에 걸쳐 나타나고 있지만, 리만 가설 자체는 여전히 미해결 상태라는 구분이 중요하다.

6. 저자 귀속과 수학의 책임 규범

수학계에서는 AI가 만든 결과가 늘어나는 현상을 두고 기대와 우려가 함께 나타나고 있다. 저명한 수학자들이 6월에 서명한 공개 선언은 AI가 수학 분야의 핵심 가치를 훼손할 수 있다고 경고했다. 선언이 특히 강조한 기준은 참인 수학적 증명이 발견의 공로를 인정받고 정확성에 책임을 지는 특정 저자에게 귀속돼야 한다는 것이다. 반면 필즈상 수상자 티머시 가워스는 이 선언에 대한 글에서 AI의 영향이 수학을 더 복잡하면서도 긍정적인 방향으로 바꿀 가능성을 물었다. 그는 수학 정리가 더 이상 개별 수학자와 연결되지 않는 세계가, 별 대부분이 천문학자의 이름을 갖지 않는 현실보다 반드시 더 문제라고 볼 수 있는지 질문했다. 이 대립은 AI의 수학적 성과를 인정할지 여부뿐 아니라 발견의 주체, 공로, 검증 책임을 앞으로 어떻게 정의할지를 둘러싼 논쟁이 아직 정리되지 않았음을 보여준다.

🧾 핵심 주장 / 시사점

  • 60개 하위 에이전트 중 핵심 아이디어를 만든 에이전트가 2개였다는 결과는, 대규모 탐색의 성과가 모든 시도의 균등한 기여보다 다수의 실패를 감수한 아이디어 선별과 검증에서 나왔음을 시사한다.
  • 3,100만 출력 토큰과 650개의 시도는 AI가 긴 탐색 과정을 수행할 수 있음을 보여주지만, 그 규모만으로 리만 가설의 일반 증명까지 보장되지는 않았다.
  • Lean 형식화와 인간 수학자의 확인은 정확성 검증을 강화했지만, AI가 만든 결과의 저자와 최종 책임자를 누구로 볼 것인지는 별도의 규범적 문제로 남았다.

✅ 액션 아이템

  • Anthropic 미공개 모델의 리만 가설 성과를 일반 증명이 아니라 성립 범위에 관한 하한 확대로 구분해 평가.
  • 60개 하위 에이전트와 3,100만 출력 토큰의 탐색에서 핵심 아이디어·실패 탐색·검증·논문 작성의 역할 분포를 함께 검토.
  • Lean 형식화와 Anthropic 사내 수학자 2명의 확인을 기준으로 정확성 검증과 저자 귀속·책임 문제를 병행 검토.

❓ 열린 질문

  • Anthropic 미공개 모델이 높인 리만 가설의 성립 범위에 관한 하한은 기존 결과보다 구체적으로 얼마나 확대됐는가?
  • 60개 하위 에이전트 중 핵심 수학 아이디어를 만든 2개와 이를 지원·검증한 에이전트의 기여는 어떻게 귀속할 수 있는가?
  • Lean 형식화와 Anthropic 사내 수학자 2명의 확인 이후에도 AI 수학 성과의 정확성에 대한 최종 책임은 누구에게 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.