Articleanthropic.com·2026년 9월 17일·0

Measurements for understanding the pace of AI development inside frontier labs

Quick Summary

Anthropic은 AI 개발 속도를 외부에서 파악할 수 있도록 AI R&D 자동화, 에이전트 감독, 연산 자원 배분의 세 측정 축과 내부 측정 결과를 공개하며, 공통 방법론과 독립 검증의 필요성을 제시한다.

Measurements for understanding the pace of AI development inside frontier labs 관련 대표 이미지

🖼️ 인포그래픽

Measurements for understanding the pace of AI development inside frontier labs 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Measurements for understanding the pace of AI development inside frontier labs의 핵심 내용을 4단계로 요약한 인포그래픽
Measurements for understanding the pace of AI development inside frontier labs 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic은 AI 개발 속도를 외부에서 파악할 수 있도록 AI R&D 자동화, 에이전트 감독, 연산 자원 배분의 세 측정 축과 내부 측정 결과를 공개하며, 공통 방법론과 독립 검증의 필요성을 제시한다.

📌 핵심 요약

  • Anthropic은 모델 생산 과정에 관한 세 측정 축을 역량 평가의 보완 수단으로 제안하고, 여러 기관의 독립적인 제3자 평가자에게 내부 위험 평가팀에 준하는 접근권을 제공해 안전 관행 검증, 사고 보고, 주요 지표 감시를 맡길 계획이다.
  • 2026년 8월 기준 Anthropic R&D Automation Index에서 Claude가 측정 대상 AI R&D 업무를 완전히 자율적으로 수행하는 영역은 없었으며, AI가 주도하는 업무는 26%, AI가 협업하는 수준 이상의 업무는 90%를 넘었다.
  • Anthropic의 가장 많이 사용되는 내부 플랫폼에서는 약 30,000개의 연구·엔지니어링 에이전트가 상시 작동했고, 해당 에이전트 행동의 100%가 실행 전 온라인 감시와 실행 후 오프라인 수집 대상이었다. 2026년 8월 10억 건 이상의 결정을 분석한 온라인 차단율은 0.002%, 약 47,000건 중 1건이었다.
  • 온라인에서 차단된 행동은 사람이 1주일 이내에 검토한다. 오프라인 감시기는 기록 1,000건당 약 1~2건을 추가 검토 대상으로 표시하며, 주당 약 100,000건의 표시된 기록을 분류기로 검토한 뒤 최우선 약 50건을 사람에게 넘긴다.
  • 7월 13~20일의 연산 사용을 조사한 결과, AI R&D 연산의 약 6%, AI 주도 AI R&D 연산의 약 12%가 안전에 배정됐다. 역량과 안전에 동등하게 기여한 토큰 및 별도의 안전장치 분류기 연산을 제외한 보수적 추정이며, 연산량은 안전에 대한 집중도를 불완전하게 대변한다.

🧩 주요 포인트

  1. AI R&D 자동화 확대 → 개발 가속과 인간 통제의 변화를 추적할 수 있지만, 연구소 간 비교에는 공통 방법론과 자체 모델 평가의 오류를 보완할 독립 검증이 필요하다.
  2. 에이전트 행동의 100% 감시 범위와 낮은 차단율 → 감독 체계의 운영 현황을 보여주지만, 감독 효과를 판단하려면 검토 지연과 알려진 오작동의 탐지 성능도 함께 확인해야 한다.
  3. 안전 연산 비중 약 6%·약 12% → 자원 배분의 시점별·개발사별 비교와 개발 속도 조율에 활용할 수 있으나, 안전 연구의 낮은 연산 집약도와 집계 제외 항목을 고려해야 한다.

🧠 상세 정리

1. 개발 속도를 이해하기 위한 세 측정 축

Anthropic은 AI 시스템의 역량이 기하급수적으로 강해지고 다음 세대 모델을 만드는 과정까지 점차 자동화하면서, 프런티어 AI 개발 속도를 이해할 정보가 더 필요해졌다고 설명한다. 제안한 측정 축은 AI가 자체 연구·개발을 얼마나 수행하는지, 에이전트 행동을 얼마나 감독하고 개입할 수 있는지, 더 강력한 모델 개발을 뒷받침하는 연산 자원을 어떻게 배분하는지의 세 가지다. 공개된 수치는 Anthropic 내부의 현황을 보여주는 단면이며, CEO Dario Amodei가 촉구한 개발 속도 조율이 이루어진다면 달라질 것으로 예상한다. 회사는 여러 기관의 독립적인 제3자 평가자를 내부에 배치하고, 내부 위험 평가팀과 비슷한 수준으로 절차·시스템·데이터에 접근하도록 할 계획이다. 이들은 안전 관행을 검증하고 사고를 보고하며 주요 지표를 감시해, 대중과 정부가 연구소 내부의 개발 속도를 더 잘 파악하도록 돕게 된다.

2. 역량 평가와 생산 과정 측정의 관계

이번 측정은 모델이 무엇을 할 수 있는지를 직접 평가하기보다 모델이 어떻게 만들어지는지에 초점을 맞춘다. Anthropic은 생산 과정을 이해하면 연산과 같은 투입 요소와 역량 같은 산출 결과 사이의 관계를 더 잘 파악할 수 있다고 본다. 따라서 이 지표들은 기존 역량 평가를 보완하며, 모델이 AI R&D를 얼마나 가속하는지에 관한 증거는 Responsible Scaling Policy(RSP) 위험 보고서를 통해 별도로 공개한다고 설명한다. Advanced AI Framework(AAIF)에서는 안전한 모델 공개를 위한 규칙과 정부가 요구할 수 있는 위험 보고서 등의 투명성 의무를 제안한다. 원문은 이러한 측정과 정책을 함께 활용하는 것이 연구소 외부에서 AI 개발 속도를 감시하기 위한 출발점이라고 제시한다.

3. AI R&D 자동화의 정의와 내부 현황

Anthropic은 AI를 활용한 후속 모델 개발이 민주주의 국가의 연구소가 역량을 빠르게 높이고 출시 전 안전 연구와 시험을 더 많이 수행하는 데 도움이 된다고 설명한다. 동시에 모델이 스스로의 개발을 가속하면 인간의 이해와 통제가 어려워질 수 있으므로, 모델이 후속 모델을 완전히 자율적으로 만드는 재귀적 자기 개선에 얼마나 가까워졌는지 파악해야 한다고 주장한다. 이를 위해 회사 내 AI R&D 업무 유형을 목록화하고 각 업무의 자동화 정도를 평가·집계하는 Anthropic R&D Automation Index의 시제품을 만들었다. Epoch AI의 척도는 AI 관여가 없는 AL0부터 인간 개입 없이 완전히 자율적으로 작동하는 AL5까지이며, AL3는 긴밀한 인간 지휘 아래 상당한 업무를 수행하는 협업, AL4는 인간 감독 아래 상위 수준의 지시로 업무 대부분을 처음부터 끝까지 수행하는 주도 수준이다. 2026년 8월 기준 측정된 업무 영역에 완전 자율 수행은 없었고, Claude가 주도하는 업무는 26%, 협업 수준 이상인 업무는 90%를 넘었다.

4. 자동화 지표의 비교 가능성과 검증 과제

Anthropic은 어떤 프런티어 개발사든 공개된 방법론을 사용해 자동화 수준을 정기적으로 발표할 수 있으며, 이를 통해 시간에 따른 변화와 잠재적으로 연구소 간 차이도 비교할 수 있다고 제안한다. 다만 연구소 사이에 공통 방법론이 없고, 자체 모델로 자체 시스템을 평가하면 평가 모델이 평가 대상과 같은 종류의 오류를 범할 수 있다는 두 가지 장애물이 있다. 이를 보완하는 방안으로 제3자나 다른 개발사의 모델이 측정 결과를 검증하되, 경쟁상 민감한 데이터의 교환을 제한하는 보호 장치를 두는 방법을 제시한다. 이러한 검증은 수치의 공개뿐 아니라 서로 다른 기관이 같은 의미로 결과를 해석할 수 있는 기반을 마련하는 데 필요하다. 원문은 자동화 측정치를 새 모델의 추가 AI R&D 활용 전 고정된 시험 기간을 요구하는 등 더 강한 요건의 발동 기준으로 삼을 가능성도 언급하지만, 이를 이미 시행 중인 제도로 제시하지는 않는다.

5. 에이전트 감독의 필요성과 측정 범위

Anthropic 직원들은 장시간 반자율적으로 작동하고 서로 업무를 위임하는 에이전트에 점점 더 많은 일을 맡기고 있다. 자동화가 협업에서 주도로 이동하면 에이전트는 다음 연구 방향처럼 더 중요한 결정을 내릴 수 있어, 개별 행동의 피해 방지와 여러 에이전트에 걸쳐 발생하는 문제의 탐지가 함께 필요해진다. 현재까지 관측한 개별 에이전트의 오작동은 드물지만, 경제 전반에서 수백만 또는 수십억 개가 작동하면 드문 사건도 반복적으로 발생할 수 있다는 것이 원문의 우려다. 측정 대상은 2026년 8월 기준 약 30,000개의 연구·엔지니어링 에이전트가 상시 작동한 가장 많이 사용되는 내부 플랫폼에 한정된다. 감독 지표는 행동이 감시기를 거치는 비중인 감시 범위, 행동부터 자동화된 감시기와 사람의 검토까지 걸리는 시간인 검토 지연, 행동이 차단·수정되거나 추가 검토 대상으로 표시되는 비중인 상향 검토율로 구성된다.

6. 온라인·오프라인 감시 결과와 해석

온라인 감시기는 모델 가중치의 외부 복사처럼 신속하고 되돌리기 어려운 피해에 대응하기 위해 모든 대상 행동을 실행 전에 보통 수초 안에 확인하고, 위험한 행동을 차단하거나 수정하도록 유도한다. 2026년 8월 10억 건 이상의 결정을 분석했을 때 차단 비율은 0.002%, 약 47,000건 중 1건이었으며, 차단된 행동은 사람이 1주일 이내에 검토한다. 오프라인 감시기는 모든 행동을 실행 후 수집하고, 모델의 비정렬 징후처럼 천천히 전개되며 되돌릴 수 있는 위험을 찾는 데 활용된다. 이 감시기는 기록 1,000건당 약 1~2건, 주당 약 100,000건을 표시하며, 여러 분류기의 오탐 확인과 초기 감독 검토에서 대부분을 처리한 뒤 최우선 약 50건을 사람에게 넘긴다. 표시된 활동은 분류기와 결정론적 통제 장치를 개선하는 데 쓰이고, 크고 임박한 위험이 생기면 배포된 에이전트의 위험한 부분을 중단한다는 방침이다. Anthropic은 알려진 오작동을 감시기가 얼마나 탐지하는지도 공개하고 독립적으로 시험해야 한다고 제안하며, METR가 과거 오프라인 감시 플랫폼을 독립적으로 레드팀 평가한 사례를 언급한다.

7. 연산 자원 배분을 측정하는 이유

AI 개발사는 더 강력한 모델 구축, 고객 서비스, 모델의 사고 과정 감사와 비정렬 연구 및 배포 안전성 평가 같은 안전 업무에 연산 자원을 사용한다. Anthropic은 이러한 배분을 살피면 개발사가 어디에 자원을 집중하는지, 그 집중이 시간에 따라 어떻게 달라지는지 파악할 수 있다고 설명한다. 연산은 AI R&D의 투입 요소 중 검증하기 비교적 쉬운 항목이므로, 향후 개발 속도를 조율할 때 중요한 수단이 될 수 있다는 주장도 제시한다. 조율된 노력은 업계가 안전에 더 많은 연산을 배정하고 정렬, 해석 가능성, 안전 시험과 평가에 자원을 늘리도록 유도할 수 있다. 다만 안전 연구는 연구자가 실험을 설계하는 데 시간이 많이 들고 실행에는 상대적으로 적은 연산이 들기 때문에, 연산량만으로 기업의 안전 집중도를 충분히 설명할 수 없다는 한계가 있다.

8. 안전 연산 비중과 보수적 집계의 한계

Anthropic은 7월 13일부터 20일까지 전체 연산 사용의 단면을 조사해 모든 작업을 소수의 범주로 나누고, AI R&D에 쓰인 연산 가운데 안전 업무가 차지하는 비중을 계산했다. 조사한 주간에 AI R&D 연산의 약 6%가 안전에 배정됐고, AI 주도 AI R&D 연산에서는 그 비중이 약 12%였다. 이 수치는 의도적으로 보수적으로 산정되어, 역량 향상과 안전 향상에 동등하게 기여한 토큰은 안전 연산으로 포함하지 않았다. 모델의 안전성을 높이는 안전장치 분류기에도 별도로 상당한 연산이 사용되며 그 규모가 비교 가능한 수준이라고 설명하지만, 해당 연산 역시 제시된 비중에는 반영하지 않았다. 따라서 원문은 절대적인 비율 자체보다 같은 기준으로 개발사 간 또는 시점 간 자원 배분을 비교할 수 있다는 점에 의미를 둔다. 제공된 본문은 연산 배분에 관해 개발사가 현재 무엇을 보고할 수 있는지 설명하려는 대목에서 끊겨 있어, 그 이후의 구체적인 제안은 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 세 측정 축을 함께 보면 자동화 확대뿐 아니라 이를 감독하는 능력과 안전에 배정하는 자원을 함께 추적할 수 있어, 개발 속도를 생산 과정의 여러 측면에서 이해할 수 있다.
  • 감시 범위 100%는 모든 위험의 탐지를 뜻하지 않는다. 낮은 차단율의 의미를 판단하려면 알려진 오작동의 탐지 성능과 사람의 검토까지 걸리는 시간에 관한 증거가 필요하다.
  • 안전 연산 비중은 연구 방식과 집계 기준의 영향을 받으므로, 약 6%와 약 12%를 안전 노력 전체의 크기로 해석하기보다 동일한 기준 아래 변화와 차이를 비교하는 데 활용하는 것이 원문의 취지에 부합한다.

✅ 액션 아이템

  • AI R&D 자동화 수준 비교 시 공통 방법론의 적용 여부와 독립 검증 근거 확인.
  • 에이전트 감독 평가에 100% 감시 범위, 차단율, 검토 지연과 알려진 오작동의 탐지 성능을 함께 반영.
  • 안전 연산 비중 약 6%·약 12% 해석 시 안전 연구의 낮은 연산 집약도와 집계 제외 항목을 함께 고려.

❓ 열린 질문

  • AI R&D 자동화 수준을 연구소 간에 비교할 공통 방법론과 독립 검증은 어떻게 마련할 것인가?
  • 에이전트 행동의 100% 감시 범위가 확보된 상황에서 알려진 오작동의 탐지 성능과 검토 지연은 어느 수준인가?
  • 안전 연산 비중 약 6%·약 12%는 집계 제외 항목과 안전 연구의 낮은 연산 집약도를 고려할 때 어떻게 비교·해석해야 하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.