ArticleAlexander Barry·2026년 9월 16일·0

GPT-6 Astra leads on math benchmarks, but not on software engineering

Quick Summary

GPT 6 Astra는 종합 ECI와 수학에서 선두지만 소프트웨어 공학에서는 Claude Fable 5.1에 뒤처지며, 두 모델의 90% 신뢰구간이 겹쳐 점수 차이를 확정적 우위로 해석하기는 어렵다.

GPT-6 Astra leads on math benchmarks, but not on software engineering 관련 대표 이미지

🖼️ 인포그래픽

GPT-6 Astra leads on math benchmarks, but not on software engineering 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

GPT-6 Astra leads on math benchmarks, but not on software engineering의 핵심 내용을 4단계로 요약한 인포그래픽
GPT-6 Astra leads on math benchmarks, but not on software engineering 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

GPT-6 Astra는 종합 ECI와 수학에서 선두지만 소프트웨어 공학에서는 Claude Fable 5.1에 뒤처지며, 두 모델의 90% 신뢰구간이 겹쳐 점수 차이를 확정적 우위로 해석하기는 어렵다.

📌 핵심 요약

  • Epoch AI의 종합 역량 지수 ECI에서 OpenAI의 GPT-6 Astra는 166.31로 Anthropic의 Claude Fable 5.1 164.47, OpenAI의 GPT-5.6 Sol 161.81, Moonshot의 Kimi K3 157.63을 앞섰다.
  • GPT-6 Astra의 Math-ECI는 169.83으로 최고 기록을 세웠지만, SWE-ECI는 163.58로 Claude Fable 5.1의 167.44보다 낮았다.
  • 추가 소프트웨어 공학 평가 결과가 반영되면서 GPT-6 Astra의 종합 ECI는 출시 당시 169.23에서 166.31로 하락했고, Claude Fable 5.1은 162.88에서 164.47로 상승했다.
  • 영역별 ECI는 종합 ECI의 벤치마크 난도 매개변수를 유지하고 해당 영역의 결과만으로 역량을 재추정한다. 종합 ECI와 비교 가능한 상대적 지표이며, 영역 내 절대적 진전을 측정하지 않는다.
  • 영역별 ECI에 사용된 평가 결과는 모델별로 3~6개에 불과하며, GPT-6 Astra와 Claude Fable 5.1의 90% 신뢰구간은 종합·수학·소프트웨어 공학 모두에서 겹친다. ECI는 결과가 추가될 때마다 다시 추정된다.

🧩 주요 포인트

  1. 종합 선두와 영역별 선두의 불일치 → 수학과 소프트웨어 공학의 역량을 구분해 모델 순위를 해석할 필요가 있다.
  2. 추가 평가에 따른 GPT-6 Astra와 Claude Fable 5.1의 점수 변화 → 출시 당시 ECI는 평가 범위가 넓어지면 달라질 수 있다.
  3. 영역별 평가 3~6개와 겹치는 90% 신뢰구간 → 점추정치의 순위만으로 확정적 성능 우위나 영역 내 절대적 진전을 주장하기 어렵다.

🧠 상세 정리

1. 종합 ECI에서 앞선 GPT-6 Astra

Epoch AI는 여러 벤치마크를 종합한 역량 지수인 ECI로 GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol, Kimi K3를 비교했다. 종합 ECI의 점추정치는 OpenAI의 GPT-6 Astra가 166.31로 가장 높고, Anthropic의 Claude Fable 5.1이 164.47로 뒤를 잇는다. OpenAI의 GPT-5.6 Sol은 161.81, Moonshot의 Kimi K3는 157.63을 기록했다. 다만 원문의 핵심은 종합 순위만으로 모델의 강점을 모두 설명할 수 없다는 것으로, 수학과 소프트웨어 공학을 나누어 보면 선두 모델이 달라진다.

2. 수학 최고 기록과 소프트웨어 공학의 다른 순위

GPT-6 Astra의 Math-ECI는 169.83으로 새 최고 기록이며, 본문에서는 이를 반올림해 170으로 소개한다. 수학에서는 Claude Fable 5.1이 165.73, GPT-5.6 Sol이 162.76, Kimi K3가 158.39로 뒤를 잇는다. 반면 소프트웨어 공학에서는 Claude Fable 5.1의 SWE-ECI가 167.44로 GPT-6 Astra의 163.58보다 높다. 이 영역에서 Kimi K3는 161.54, GPT-5.6 Sol은 160.47을 기록해 두 모델 사이의 순서도 종합 ECI와 달라진다. 따라서 GPT-6 Astra의 종합 선두라는 결과와 소프트웨어 공학에서의 상대적 열세는 함께 해석해야 한다.

3. 추가 평가로 좁아진 출시 당시의 격차

출시 전 평가를 바탕으로 산정한 GPT-6 Astra의 출시 당시 종합 ECI는 169.23이었으나, 소프트웨어 공학 결과가 더 확보되면서 166.31로 내려갔다. Claude Fable 5.1은 같은 비교에서 162.88에서 164.47로 상승했다. GPT-6 Astra의 전체 평가 수는 9개에서 16개로, 소프트웨어 공학 평가는 MirrorCode 하나에서 WeirdML, DeepSWE, FrontierCode를 포함한 4개로 늘었다. Claude Fable 5.1은 전체 평가가 12개에서 15개로 늘었고, 소프트웨어 공학 평가는 FrontierCode 하나에서 MirrorCode와 WeirdML을 더한 3개가 됐다. 본문은 9월 3일과 13일 갱신 사이의 10일 동안 각각 약 2.9점 하락과 1.6점 상승이 있었다고 설명하며, 비교표의 현재 스냅샷 날짜는 9월 15일로 표기한다.

4. 영역별 ECI의 산정 방식과 해석 범위

Math-ECI와 SWE-ECI는 각각 수학과 소프트웨어 공학 벤치마크만 사용해 모델의 역량을 다시 추정한 영역별 지수다. 이때 종합 ECI를 적합할 때 얻은 벤치마크 난도 매개변수는 유지하므로, 산출된 영역별 점수는 종합 ECI 점수와 비교할 수 있다. 목적은 특정 영역에서 드러나는 모델의 강도를 종합 역량과의 관계 속에서 보여주는 데 있다. 따라서 영역별 ECI를 해당 분야의 절대적 진전을 추적하는 지표로 해석해서는 안 된다는 것이 원문의 명시적 제한이다. Epoch AI는 영역별 ECI Explorer에서 이러한 구분과 사용자가 선택한 벤치마크 부분집합을 탐색할 수 있다고 안내한다.

5. 사용된 데이터와 모델별 평가 범위

데이터 설명에 따르면 이번 지수는 2026년 9월 13일까지 확보된 벤치마크 점수를 바탕으로 하며, 다운로드 자료의 갱신일은 9월 15일이다. GPT-6 Astra의 수학 평가는 OTIS Mock AIME, FrontierMath Tiers 1–3, FrontierMath Tier 4, ProofBench의 4개다. 소프트웨어 공학 평가는 MirrorCode, WeirdML, DeepSWE, FrontierCode의 4개로 구성된다. 종합 ECI의 평가 수는 GPT-6 Astra 16개, Claude Fable 5.1 15개, GPT-5.6 Sol 22개, Kimi K3 19개로 서로 다르다. 수학은 네 모델 모두 4개지만 소프트웨어 공학은 같은 순서로 4개, 3개, 6개, 5개이므로, 점수 비교 시 모델별 평가 범위의 차이도 함께 확인해야 한다.

6. 신뢰구간과 계속 바뀌는 점수의 한계

영역별 지수는 각각 3~6개의 평가 결과에 의존하므로 신뢰구간이 비교적 넓으며, GPT-6 Astra와 Claude Fable 5.1은 세 종류의 ECI 모두에서 90% 신뢰구간이 겹친다. 종합 ECI의 구간은 각각 163.00~171.88과 161.36~168.28이고, Math-ECI는 165.98~175.37과 162.84~175.91이다. SWE-ECI 역시 각각 160.42~169.82와 161.95~178.53으로 겹친다. 따라서 수학에서는 GPT-6 Astra, 소프트웨어 공학에서는 Claude Fable 5.1이 점추정치상 앞선다는 관찰과 순위의 불확실성을 함께 보존해야 한다. 또한 ECI는 결과가 추가될 때마다 다시 추정되므로, 현재 점수를 고정된 최종 평가로 취급하기 어렵다.

🧾 핵심 주장 / 시사점

  • 종합 ECI가 높은 모델도 모든 영역에서 선두는 아니므로, 수학과 소프트웨어 공학을 구분한 비교가 종합 순위의 해석을 보완한다.
  • GPT-6 Astra와 Claude Fable 5.1의 점수 변화는 출시 당시 확보된 평가의 범위가 이후의 상대적 순위와 격차 해석에 영향을 줄 수 있음을 보여준다.
  • 영역별 ECI의 비교 가능성과 측정 한계는 함께 고려해야 한다. 종합 역량 대비 강점을 읽는 데는 유용하지만, 겹치는 신뢰구간이나 절대적 진전을 측정하지 않는다는 제약을 없애지는 않는다.

✅ 액션 아이템

  • GPT-6 Astra와 Claude Fable 5.1 비교 시 종합 ECI와 수학·소프트웨어 공학의 영역별 순위를 함께 검토한다.
  • 출시 당시 ECI를 해석할 때 추가 평가에 따른 GPT-6 Astra의 하락과 Claude Fable 5.1의 상승을 반영한다.
  • 영역별 ECI 해석에 평가 3~6개, 겹치는 90% 신뢰구간, 절대적 진전을 측정하지 않는다는 제약을 명시한다.

❓ 열린 질문

  • 수학과 소프트웨어 공학 중 어느 영역을 중시하느냐에 따라 GPT-6 Astra와 Claude Fable 5.1의 비교 결론은 어떻게 달라지는가?
  • 추가 평가 결과가 반영되면 GPT-6 Astra와 Claude Fable 5.1의 종합 ECI 격차는 어떻게 변할 것인가?
  • 영역별 평가가 3~6개이고 90% 신뢰구간이 겹치는 상황에서 두 모델의 성능 차이를 어느 정도까지 확신할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.