How UK AISI and EvalEval Are Making Benchmark Results Reproducible
Quick Summary
UK AI Security Institute(AISI)는 EvalEval의 Every Eval Ever(EEE) 스키마와 Evaluation Cards를 활용해 검증된 벤치마크 결과와 평가 설정을 공개하며, AI 평가의 재현성과 검증 가능성을 높이고 있다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
UK AI Security Institute(AISI)는 EvalEval의 Every Eval Ever(EEE) 스키마와 Evaluation Cards를 활용해 검증된 벤치마크 결과와 평가 설정을 공개하며, AI 평가의 재현성과 검증 가능성을 높이고 있다.
📌 핵심 요약
- AISI와 EvalEval은 NeurIPS 2025에 맞춰 열린 공동 워크숍에서 시작한 연구 협력을 공유 인프라의 실제 활용으로 확장했으며, AISI의 피드백은 Every Eval Ever(EEE) 스키마 형성에 기여했다.
- 평가 결과는 다양한 형식과 플랫폼에 흩어져 있고 재현에 필요한 정보가 부족하며, 평가 재실행 비용도 지나치게 클 수 있다. EvalEval은 EEE와 Evaluation Cards를 통해 결과와 해석에 필요한 정보를 공통 구조로 제공한다.
- 이번 공개에는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0의 검증된 결과·맥락·설정 정보가 포함되며, 대상은 Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, GPT-5.4의 6개 모델이다. Cyber CTFs와 The Last Ones 결과도 포함되지만, 이 두 사이버 평가는 일부만 겹치는 별도 모델 구성을 사용한다.
- 공개 데이터는 추론 시 연산량과 평가 프로토콜이 벤치마크 성능에 미치는 영향을 연구한 AISI의 논문 How Inference Compute Shapes Frontier LLM Evaluation에 수반된다. Humanity's Last Exam에서는 매 시도 후 오라클의 정답 여부 피드백을 받은 모델들이 토큰 사용량 증가에 따라 추가 과제를 계속 해결했다.
- AISI는 적절한 경우 공개된 평가 방법과 결과를 Evaluation Cards로 제공한다. 설정 정보가 있는 결과는 연구 간 비교의 검증된 참조점이 되며, EEE 채택이 확대되면 더 폭넓고 신뢰할 수 있는 메타연구를 지원할 수 있다.
🧩 주요 포인트
- 평가 재실행의 높은 비용과 보고 정보의 부족 → EEE의 공통 보고 구조는 기존 결과를 해석하고 검증하는 데 필요한 기반을 제공한다.
- Humanity's Last Exam의 성능이 추론 시 연산량과 평가 프로토콜에 따라 변화 → 벤치마크 점수를 비교할 때 토큰 사용량과 정답 여부 피드백 같은 수행 조건을 함께 고려해야 한다.
- Terminal-Bench 2.0의 동일 모델 결과도 서로 다른 평가 설정에서 산출 → Evaluation Cards의 맥락·설정 정보는 겉으로 비슷한 점수의 조건 차이를 파악하고 연구 간 비교를 해석하는 데 도움을 준다.
🧠 상세 정리
1. 공동 연구에서 평가 결과 공개로 확장된 협력
2026년 9월 22일 발표된 글은 UK AI Security Institute(AISI)가 EvalEval의 인프라로 평가 결과를 공개하는 협력 단계를 소개한다. 두 조직은 NeurIPS 2025에 맞춰 열린 공동 워크숍에서 시작한 연구를 함께 수행했으며, AISI가 제공한 피드백은 Every Eval Ever(EEE) 스키마를 다듬는 데 기여했다. 이번 단계는 그렇게 마련한 공유 인프라를 실제 평가 결과 보고에 적용한다는 의미를 갖는다. 협력의 목표는 결과를 공개하는 데 더해, 평가 과학의 재현성과 검증 가능성을 높이는 데 있다.
2. 재현을 어렵게 하는 보고 방식과 공통 인프라
AI 배포가 빨라지면서 평가는 모델과 시스템의 성능을 판단하는 중요한 근거가 되고 있다. 그러나 결과는 여러 형식과 플랫폼, 발표 경로에 흩어져 있으며, 재현에 필요한 정보가 충분히 제공되지 않는 경우가 많고 평가를 다시 실행하는 비용 자체도 지나치게 클 수 있다. EvalEval은 공통 보고 스키마인 EEE와 공개 플랫폼인 Evaluation Cards를 통해 결과와 해석에 필요한 정보를 같은 구조로 모으려 한다. 이는 OptStop을 통한 평가 효율화, HiBayES를 통한 통계적 엄밀성 강화, 트랜스크립트 분석과 능력 유도 분야의 표준화 등 AISI의 기존 작업과 이어진다. 두 조직은 평가 보고의 공백을 찾아 이를 줄일 공유 인프라를 구축하고 있다.
3. 공개된 벤치마크와 모델의 범위
AISI는 적절한 경우 이미 공개된 평가 방법과 결과를 Evaluation Cards에서 제공하며, 이번 공개에는 논문 주요 실험의 5개 벤치마크에 대한 검증된 결과와 맥락, 설정 정보가 담겼다. 해당 벤치마크는 HealthBench, FrontierMath, Humanity's Last Exam, SWE-Bench Pro, Terminal-Bench 2.0이다. 이 결과는 Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2, GPT-5.4의 6개 프런티어 모델을 다룬다. 관련 사이버 평가인 Cyber CTFs와 The Last Ones의 결과도 포함되지만, 두 평가는 주요 실험과 일부만 겹치는 다른 모델 구성을 사용하므로 대상 범위를 구분해야 한다.
4. 추론 시 연산량과 평가 프로토콜에 따른 성능 변화
공개 데이터는 AISI의 논문 How Inference Compute Shapes Frontier LLM Evaluation에 수반되며, 이 논문은 추론 시 연산량과 평가 프로토콜에 따라 벤치마크 성능이 어떻게 달라지는지 연구한다. 글에 소개된 Humanity's Last Exam 그래프의 각 곡선은 시도한 과제 중 주어진 토큰 수 이내에 해결한 과제의 누적 비율을 나타낸다. 이때 과제별로 관측된 최초 성공을 기준으로 삼는다. 모델이 각 시도 뒤 오라클로부터 정답 여부 피드백을 받았을 때는 토큰 사용량이 늘어남에 따라 추가 과제를 계속 해결했다. 이 관찰은 평가 점수를 해석할 때 연산량뿐 아니라 피드백 제공 방식 같은 프로토콜도 함께 살펴야 한다는 근거가 된다.
5. 설정 정보가 있는 공개 결과의 비교 가치
글은 트랜스크립트 수준의 투명성이 재현성뿐 아니라 분석과 진단에도 중요하다고 설명한다. 평가 결과와 실행 설정이 함께 공개되면 연구자와 실무자는 개별 연구를 더 자세히 살피고, 더 넓은 평가 생태계의 결과와 비교할 수 있다. 다른 보고서에 이런 세부 정보가 부족할 때 AISI의 공개 결과는 설정 선택이 성능에 미치는 영향을 해석하는 검증된 참조점이 된다. 글은 동일 모델을 서로 다른 설정으로 평가한 다른 보고 결과와 AISI의 Terminal-Bench 2.0 결과를 나란히 제시한다. EEE를 채택하는 평가자가 늘어나면 이런 공개 비교가 더 폭넓고 신뢰할 수 있는 메타연구를 지원할 수 있다는 것이 제시된 기대다.
6. 참여 방식과 두 조직의 역할
글은 모델 개발자에게 검증된 평가 결과를 보고하고, 평가 개발자에게 EEE 스키마로 벤치마크와 실행 데이터를 보고할 것을 제안한다. 평가·거버넌스·정책 연구자는 Evaluation Cards를 벤치마크나 모델별로 탐색하거나 평가 보고의 전반적 상태를 조사하는 데 활용할 수 있다. EvalEval Coalition은 평가의 적용 가능성과 유용성을 문서화하는 방식의 합의 부족을 해소하고, 과학 연구와 정책 분석에 중요한 영향의 평가 범위를 넓히려는 연구 공동체다. 대표 프로젝트인 EEE는 평가 결과의 공통 스키마와 저장소이며, Evaluation Cards는 벤치마크 메타데이터, 평가 실행 데이터, 모델 메타데이터를 해석 가능한 기록으로 결합한다. 영국 정부의 과학혁신기술부 소속 연구 조직인 AISI는 첨단 AI의 역량과 영향을 연구하고 완화책을 개발·시험하며, 정부가 위험을 과학적으로 이해하고 정책을 수립하도록 지원한다.
🧾 핵심 주장 / 시사점
- 재현성 개선에는 평가 재실행뿐 아니라, 기존 결과의 조건을 충분히 공개해 검토와 해석을 가능하게 하는 보고 인프라도 중요하다.
- Humanity's Last Exam의 사례는 관측된 성능이 모델과 추론 시 연산량, 피드백 프로토콜이 결합된 결과임을 보여준다.
- EEE와 Evaluation Cards의 활용 확대는 개별 평가의 투명성을 높이는 데서 나아가, 평가 보고 자체를 연구하는 메타연구의 기반이 될 수 있다.
✅ 액션 아이템
- Evaluation Cards에서 공개된 결과의 맥락·설정 정보를 함께 검토해 벤치마크 비교에 반영.
- Humanity's Last Exam 결과 해석 시 토큰 사용량과 정답 여부 피드백 조건을 함께 확인.
- Cyber CTFs와 The Last Ones를 비교할 때 주요 실험의 6개 모델과 일부만 겹치는 평가 대상 범위를 구분.
❓ 열린 질문
- Humanity's Last Exam에서 토큰 사용량과 정답 여부 피드백은 각각 성능 변화에 얼마나 기여하는가?
- Terminal-Bench 2.0의 동일 모델 결과를 비교할 때 평가 설정 차이는 보고된 성능 차이를 얼마나 설명하는가?
- EEE 채택이 확대되면 평가 보고 정보의 부족은 얼마나 줄고 메타연구의 신뢰성은 얼마나 높아질 수 있는가?