ArticleAlexander Barry·2026년 9월 1일·0

The ECI frontier has advanced by 14 points per year since the introduction of reasoning models

Quick Summary

Epoch AI에 따르면 2024년 9월 추론 모델 도입 이후 ECI 최고 성능선은 연간 14점 상승해 비추론 모델의 연간 6점보다 빠르게 발전했다.

The ECI frontier has advanced by 14 points per year since the introduction of reasoning models 관련 대표 이미지

🖼️ 인포그래픽

The ECI frontier has advanced by 14 points per year since the introduction of reasoning models 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The ECI frontier has advanced by 14 points per year since the introduction of reasoning models의 핵심 내용을 4단계로 요약한 인포그래픽
The ECI frontier has advanced by 14 points per year since the introduction of reasoning models 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Epoch AI에 따르면 2024년 9월 추론 모델 도입 이후 ECI 최고 성능선은 연간 14점 상승해 비추론 모델의 연간 6점보다 빠르게 발전했다.

📌 핵심 요약

  • Epoch AI는 OpenAI의 o1-mini와 o1-preview가 등장한 2024년 9월 이후 추론 모델의 ECI 최고 성능선이 연간 14점의 선형 상승 추세를 보였다고 설명한다.
  • 추론 최고 성능 모델의 ECI는 2024년 9월 o1-mini의 136.64에서 2025년 8월 GPT-5의 150.00을 거쳐 2026년 6월 Claude Fable 5의 162.48까지 높아졌다.
  • 비추론 최고 성능선의 상승 속도는 연간 6점이며, 표에 제시된 해당 계열은 2023년 3월 GPT-4의 126.19부터 2025년 2월 GPT-4.5의 137.63까지 이어진다.
  • 표는 추론 최고 성능, 비추론 최고 성능, 기타 출시 모델을 구분하며, o1-preview와 DeepSeek-R1도 기타 출시 모델에 포함한다.
  • 다수 모델에 ECI 90% 신뢰구간이 제공되지만 일부는 비어 있으며, 제공된 본문에는 추세 산출 방법의 상세 설명이 없고 마지막 DeepSeek-V3 항목도 중간에서 끊겨 있다.

🧩 주요 포인트

  1. 연간 14점과 연간 6점의 차이 → 추론·비추론 최고 성능선의 발전 속도를 구분해 해석할 필요가 있다.
  2. o1-preview와 DeepSeek-R1의 기타 출시 분류 → 최고 성능선 포함 여부와 추론 모델 여부를 동일하게 취급할 수 없다.
  3. ECI 90% 신뢰구간의 중첩·누락과 본문 일부 누락 → 개별 모델의 점수 차이와 추세의 통계적 근거를 판단하는 데 한계가 있다.

🧠 상세 정리

1. 추론 모델 도입 이후의 상승 속도

원문의 핵심 주장은 2024년 9월 첫 추론 모델이 등장한 뒤 Epoch Capabilities Index, 즉 ECI의 최고 성능선이 연간 14점의 속도로 선형 상승했다는 것이다. 도입 시점을 설명하는 모델로는 OpenAI의 o1-mini와 o1-preview가 명시되며, 비교 대상인 비추론 모델의 최고 성능선은 연간 6점 상승한 것으로 제시된다. 이 수치는 두 계열의 최고 성능이 시간에 따라 발전한 속도를 비교하는 것이므로, 모든 출시 모델이 매년 같은 점수만큼 향상되었다는 뜻으로 읽을 수는 없다. 제공된 본문은 이러한 추세 설명에 이어 모델별 점수표를 제시하지만, 상승률을 산출한 구체적인 절차나 추세 자체의 불확실성을 설명하는 내용은 포함하지 않는다.

2. 추론 최고 성능선의 초기 전개

추론 최고 성능 계열의 첫 항목은 2024년 9월 12일 출시된 o1-mini로, ECI는 136.64이며 90% 신뢰구간은 132.97~138.02이다. 같은 해 12월 17일 출시된 o1은 142.67로 기록되어, 표에 제시된 추론 계열의 최고 점수가 연말까지 높아졌음을 보여준다. 이후 2025년 3월 31일 Gemini 2.5 Pro는 144.63, 4월 16일 o3는 147.06, 6월 10일 o3-pro는 147.51을 기록하며 최고 성능선의 후속 항목으로 이어진다. 이 구간에는 OpenAI와 Google DeepMind의 모델이 함께 등장하며, 출시 사이의 점수 증가 폭도 서로 다르므로 연간 14점이라는 추세를 각 모델의 일정한 성능 증가량으로 해석해서는 안 된다.

3. 2025년 하반기부터 2026년까지의 추론 모델

2025년 8월 7일 GPT-5의 ECI는 150.00이며, 10월 7일 GPT-5 Pro는 150.29, 11월 18일 Gemini 3 Pro는 153.06으로 제시된다. 이어 12월 11일 GPT-5.2 Pro가 155.07을 기록했고, 2026년 2월 5일 GPT-5.3 Codex와 3월 5일 GPT-5.4 Pro는 각각 156.22와 158.55에 도달했다. 4월 23일 GPT-5.5 Pro는 161.71, 6월 9일 Anthropic의 Claude Fable 5는 162.48로 기록되어 제공된 표의 추론 최고 성능 계열을 마무리한다. 이 흐름은 여러 개발사의 모델이 최고 성능선을 이어 가는 모습을 보여주지만, 개별 출시 간 점수 차이의 크기만으로 통계적으로 확실한 우위를 단정할 근거까지 제공하지는 않는다.

4. 비추론 최고 성능선의 비교 흐름

비추론 최고 성능 계열은 2023년 3월 14일 GPT-4의 ECI 126.19에서 시작하며, 2024년 2월 Claude 3 Opus의 126.51과 4월 GPT-4 Turbo의 127.61로 이어진다. 이후 5월 GPT-4o는 128.80, 6월 Claude 3.5 Sonnet은 130.00, 9월 Gemini 1.5 Pro는 132.69, 10월 Claude 3.5 Sonnet은 134.29로 기록된다. Gemini 2.0 Flash는 2024년 12월판에서 135.16, 2025년 2월판에서 135.80을 기록했으며, 해당 계열의 마지막 항목인 GPT-4.5는 137.63이다. 원문은 이 계열의 상승 속도를 연간 6점으로 요약하지만, 제시된 비추론 계열과 추론 계열의 마지막 출시 시점은 다르므로 마지막 점수끼리의 차이를 동일 시점의 성능 격차로 취급할 수는 없다.

5. 기타 출시 모델이 보여주는 비교 범위

표의 기타 출시 범주에는 2023년 LLaMA, Falcon, PaLM 2, Mistral, Qwen 계열부터 2024년 Llama 3, Gemma 2, DeepSeek-V3 등 다양한 모델이 포함되어 있다. 예를 들어 LLaMA-65B는 109.71, Llama 3-70B는 122.56, Llama 3.1-405B는 128.97로 기록되어 최고 성능선 외에도 여러 출시 모델의 점수를 확인할 수 있다. 추론 모델의 도입 사례로 본문에 직접 언급된 o1-preview도 이 범주에서 135.77로 제시되며, 2025년 DeepSeek-R1의 139.72와 o3-mini의 141.49 역시 기타 출시 항목에 속한다. 따라서 이 범주는 비추론 모델만을 뜻하지 않으며, 모델의 추론 여부와 표에서 최고 성능선의 구성원으로 분류되었는지는 구분해서 읽어야 한다.

6. 신뢰구간과 제공 자료의 해석 한계

표는 모델명, 개발 조직, 출시일, ECI 점수, ECI 90% 신뢰구간의 하한과 상한, 계열을 함께 제시하여 점수의 크기와 추정 범위를 확인할 수 있게 한다. GPT-5.5 Pro의 신뢰구간은 158.95~164.88이고 Claude Fable 5는 159.33~165.76으로 서로 겹치므로, 중심 점수의 순서만으로 두 모델의 우위를 확정하기는 어렵다. GPT-5와 Claude 3.5 Sonnet처럼 신뢰구간 값이 비어 있는 항목도 있지만, 제공된 본문에는 그 이유가 설명되어 있지 않다. 또한 마지막 DeepSeek-V3의 2025년 3월판 항목은 출시일 부분에서 끊겨 있고 추세 산출 방법의 상세 설명도 없으므로, 누락된 점수나 통계 절차를 보충해 사실처럼 제시할 수는 없다.

🧾 핵심 주장 / 시사점

  • 연간 14점이라는 수치는 최고 성능선의 시간적 추세이며, 개별 모델의 출시마다 동일한 폭으로 점수가 상승한다는 의미는 아니다.
  • 기타 출시 범주에도 추론 모델이 포함되므로, 표의 계열 분류를 모델의 추론 방식에 대한 분류로 대체하면 해석이 왜곡된다.
  • 추론·비추론 계열의 마지막 출시 시점이 다르고 일부 신뢰구간도 누락되어 있어, 마지막 점수나 작은 점수 차이만으로 비교를 마무리하기 어렵다.

✅ 액션 아이템

  • 추론·비추론 최고 성능선의 발전 속도를 연간 14점과 연간 6점으로 구분해 비교.
  • o1-preview와 DeepSeek-R1의 기타 출시 분류를 반영해 최고 성능선 포함 여부와 추론 여부를 구분.
  • 개별 모델의 점수 차이를 해석할 때 ECI 90% 신뢰구간의 중첩·누락과 추세 산출 방법의 설명 부재를 함께 고려.

❓ 열린 질문

  • 연간 14점과 연간 6점의 추세는 구체적으로 어떤 산출 방법에 근거하는가?
  • o1-preview와 DeepSeek-R1을 기타 출시 모델로 분류하는 구체적인 기준은 무엇인가?
  • 일부 모델의 ECI 90% 신뢰구간이 비어 있는 이유는 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.