Articlehai.stanford.edu·2026년 9월 25일·0

The Tests That Grade AI May Be Getting It Wrong

Quick Summary

Stanford 연구진은 AI 벤치마크가 표방한 능력을 제대로 측정하지 못할 수 있다며, 투자·규제·조달에 쓰이는 점수의 타당성과 실제 환경에서의 예측력을 검증해야 한다고 주장한다.

The Tests That Grade AI May Be Getting It Wrong 관련 대표 이미지

🖼️ 인포그래픽

The Tests That Grade AI May Be Getting It Wrong 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The Tests That Grade AI May Be Getting It Wrong의 핵심 내용을 4단계로 요약한 인포그래픽
The Tests That Grade AI May Be Getting It Wrong 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Stanford 연구진은 AI 벤치마크가 표방한 능력을 제대로 측정하지 못할 수 있다며, 투자·규제·조달에 쓰이는 점수의 타당성과 실제 환경에서의 예측력을 검증해야 한다고 주장한다.

📌 핵심 요약

  • Stanford 연구진과 협력자들은 측정과학·심리측정학을 활용해 널리 쓰이는 56개 벤치마크를 조사했으며, 표방한 속성을 제대로 측정하지 못하거나 같은 속성을 측정한다는 시험끼리 결과가 불일치하는 양상을 반복적으로 발견했다.
  • 편향 벤치마크 BBQ는 정보가 부족한 객관식 질문을 사용하지만, 모델의 편향과 함정 질문을 알아채는 독해 능력을 구분하지 못할 수 있다.
  • 연구진은 같은 속성을 측정하는 시험들의 결과가 유사한지 확인하는 수렴 타당도와, 서로 다른 속성을 측정하는 시험들이 구별되는지 확인하는 변별 타당도를 AI 평가에 적용할 것을 제안한다.
  • 영어 중심의 안전성 벤치마크를 다른 언어로 번역하면 실제 안전장치 약화와 번역에 따른 문항 의미·난도 변화가 함께 나타날 수 있으며, 측정 모형은 단일 점수로 구별하기 어려운 요인들을 분리하는 데 도움을 준다.
  • 벤치마크 점수는 수십억 달러 규모의 투자와 규제·조달 결정에 영향을 주지만, 연구진은 특정 점수가 해당 결정을 뒷받침하는지 검증하는 경우가 드물고 실제 환경의 행동에 대한 예측을 사후 대조할 수 있게 기록하는 일도 거의 없다고 지적한다.

🧩 주요 포인트

  1. 개 벤치마크에서 드러난 측정 불일치 → 순위나 점수 차이를 능력 차이로 해석하기 전에 수렴 타당도·변별 타당도 검증이 필요하다.
  2. BBQ의 독해 능력 혼입과 다국어 안전성 평가의 번역 영향 → 평가 대상의 특성과 시험 자체의 난도를 분리해야 점수 하락의 원인을 해석할 수 있다.
  3. 투자·규제·조달에 활용되는 벤치마크의 예측력 검증 부족 → 시험 간 비교를 넘어 실제 환경의 행동과 점수를 대조하는 검증이 필요하다.

🧠 상세 정리

1. AI를 평가하는 시험 자체에 대한 질문

AI 개발자들은 새로운 모델을 공개하기 전에 추론 능력부터 사용 안전성까지 다양한 특성을 벤치마크로 평가하며, 이 점수에는 수십억 달러 규모의 투자와 정책적 판단이 걸려 있다. Stanford 연구진과 협력자들은 평가 대상을 모델에서 시험 자체로 옮겨, 벤치마크가 자신이 측정한다고 주장하는 것을 실제로 측정하는지 물었다. 관련 연구 두 편은 10월 샌프란시스코에서 열리는 제3회 언어 모델링 연례 학술대회에서 발표될 예정이며, Stanford HAI가 연구를 일부 지원했다. 인터뷰에 참여한 조교수 Sanmi Koyejo와 대학원생 Sang Truong은 연구 결과를 바탕으로 AI 분야가 벤치마크의 영향력에 걸맞은 엄밀성을 갖춰야 한다고 주장한다.

2. 학술적 시험에서 산업의 판단 기준으로

Koyejo는 벤치마크가 과거에는 주로 학술 활동이었으며, Stanford HAI의 Fei-Fei Li가 구축한 ImageNet을 가장 유명한 사례로 소개한다. 지금도 공개 벤치마크 대부분은 학계에서 만들지만 기업과 다른 이해관계자들도 공개하며, 제작자들은 자신의 시험이 표준으로 자리 잡기를 원한다. 개발자들은 이러한 시험으로 모델의 추론·안전성·편향을 평가하고, 한 모델의 성능 개선이나 서로 다른 모델의 차이를 판단한다. 연구진이 측정과학과 심리측정학의 도구로 널리 쓰이는 56개 벤치마크를 조사하자, 표방한 속성을 제대로 측정하지 못하거나 같은 속성을 측정한다는 시험끼리 결과가 어긋나는 양상이 반복적으로 나타났다. 벤치마크가 AI 산업의 핵심 기준이 된 만큼 정확성뿐 아니라 재현성과 확장성도 중요하다는 것이 Truong의 설명이다.

3. BBQ가 편향과 독해 능력을 혼동하는 방식

편향을 측정하는 인기 벤치마크 BBQ에는 의도적으로 정보가 부족한 객관식 질문들이 포함되며, John과 Mary가 체육관에 갈 때 누가 더 강한지 묻는 문제가 그 예다. 나이나 다른 개인적 정보를 알 수 없으므로 정답은 정보가 부족해 알 수 없다는 선택지이며, 남성이 더 강할 것이라고 추정해 John을 고르면 성별 편향이 있다는 평가를 받는다. 그러나 Koyejo는 실제로 편향된 모델도 함정 질문을 잘 알아채면 모른다고 답해 편향이 없는 것으로 평가될 수 있다고 지적한다. 반대로 편향이 없는 모델이라도 질문의 함정을 놓치면 편향이 있다는 점수를 받을 수 있어, 이 문항만으로는 두 경우를 구분하기 어렵다. 연구진의 비판은 이 시험이 이름에서 약속하는 편향보다 독해 능력에 가까운 특성을 측정할 수 있으며, 이를 구분할 더 엄밀한 방법이 필요하다는 것이다.

4. 수렴 타당도와 변별 타당도의 적용

Truong에 따르면 측정이론은 점수가 어떻게 만들어지는지 설명하는 틀과, 벤치마크가 주장한 속성을 실제로 측정하는지에 관한 가설을 검증할 통계적 방법을 제공한다. Koyejo는 SAT 같은 표준화 시험에도 같은 이론이 적용되며, AI 모델의 능력을 측정하는 일과 학생의 학습을 평가하는 일 사이에 여러 공통점이 있다고 설명한다. 수렴 타당도는 같은 속성을 측정한다는 벤치마크들이 비슷한 결과를 내는지 확인하고, 변별 타당도는 서로 다른 속성을 측정한다는 벤치마크들이 실제로 구별되는 결과를 보이는지 살핀다. 인간의 능력을 측정해 온 심리측정학은 개별 문항이 특정 능력을 정확히 측정하도록 오랫동안 방법을 발전시켜 왔다. 연구진은 이러한 축적된 엄밀성을 AI 벤치마크에도 도입해, 시험의 명칭과 점수만으로 측정 대상이 분명하다고 가정하는 문제를 줄이려 한다.

5. 다른 언어에서 안전성 점수가 하락하는 두 원인

두 번째 연구는 영어 이외의 언어에서 AI 안전성 점수가 저하되는 현상을 다루며, 모델이 금지된 출력을 하도록 유도하는 탈옥 공격을 중요한 평가 맥락으로 삼는다. Truong은 주요 안전성 벤치마크 거의 모두가 영어로 작성되어 있고, 이를 번역하면 모델의 안전장치와 시험 자체라는 두 측면에서 문제가 발생할 수 있다고 설명한다. 영어에서는 실패한 공격이 스페인어나 스와힐리어에서는 성공할 수 있지만, 동시에 번역 과정에서 문항의 표현이나 의미가 달라지고 질문이 더 어려워질 수도 있다. 가능한 원인에는 학습 자료의 비영어 언어 부족, 부정확한 프롬프트 번역, 번역으로 인한 의도치 않은 난도 상승 등이 포함된다. 따라서 안전성 점수 하나만으로 실제 방어 능력이 약해진 것인지 평가 도구가 달라진 것인지 판단하기 어렵고, 측정과학은 어떤 가능성이 해당하는지 검증하는 데 도움을 준다.

6. 단일 안전성 점수를 구성 요인으로 분해

Koyejo는 다국어 평가에 측정 모형을 적용할 때의 핵심 장점으로, 하나의 안전성 숫자를 비교하는 수준에서 벗어나 성능을 여러 구성 요인으로 나눠 이해할 수 있다는 점을 든다. 그가 제시한 요인에는 언어와 무관한 안전성의 견고함, 모델에 가해지는 시험의 난도, 일반적인 언어 처리의 어려움, 특정 프롬프트가 언어 간 안전성 격차를 드러내는 방식이 포함된다. 이러한 분해는 같은 점수 하락에도 서로 다른 요인이 관여할 수 있다는 앞선 문제를 더 세밀하게 살펴볼 수 있게 한다. 연구진은 이를 안전성을 이루는 여러 측면을 들여다보는 방법으로 설명하며, 단일 점수만으로는 숨겨지는 복잡성을 측정과학으로 분석하려 한다. 다만 본문은 개별 언어별 하락 폭이나 각 구성 요인의 기여도를 수치로 제시하지 않고, 요인을 구분하는 접근의 의미에 초점을 맞춘다.

7. 투자·규제·조달 결정을 뒷받침할 수 있는가

Truong은 성능 순위표에서 모델이 차지하는 위치가 시장 가치를 형성하고, 개발자와 투자자의 재무적 판단 및 정책 입안자의 규제에 영향을 미친다고 강조한다. 조직과 정부도 벤치마크 수치를 조달 결정에 사용하기 때문에, 점수의 정확성과 해석 가능성은 연구자들만의 관심사가 아니다. Koyejo는 평가 절차가 AI의 발전 방향을 좌우하므로 평가가 잘못되었을 때의 위험도 크고 커지고 있다고 주장한다. 그의 핵심 질문은 벤치마크를 규제에 포함할지 여부보다, 특정 점수가 그 점수에 근거한 특정 결정을 실제로 뒷받침하는지 누군가 검증했는가에 있다. 그는 보통 이러한 확인이 이루어지지 않았다고 지적하면서도, 이를 수치를 버릴 이유가 아니라 고칠 수 있는 문제로 본다.

8. 시험끼리의 비교를 넘어 실제 행동으로 검증

Koyejo는 측정을 잘하는 분야들이 측정 도구를 구축하고 유지하는 데 상당한 노력을 기울여 왔지만, AI 분야는 아직 그 수준의 노력을 기울이지 않았다고 평가한다. 그는 벤치마크 점수를 시스템이 실제 환경에 나왔을 때 어떻게 행동할지에 대한 예측으로 보며, 이 예측이 현실에서 확인될 수 있어야 한다고 주장한다. 그러나 그에 따르면 나중에 실제로 일어난 일과 대조할 수 있는 형태로 예측을 기록하는 경우는 거의 없다. 이런 기록과 대조가 없으면 평가 도구들은 서로를 기준으로만 보정되고, 현실의 결과를 기준으로 검증되지 못한다. 연구진은 이를 현재 평가 체계에서 빠진 요소이자 자신들이 구축하고 있는 방향으로 제시하며, 벤치마크의 유용성을 높이기 위해 실제 행동과의 연결을 강조한다.

🧾 핵심 주장 / 시사점

  • 벤치마크의 이름이 측정 대상을 보장하지는 않는다. BBQ 사례처럼 한 점수에 독해 능력이 섞이면 편향에 대한 해석이 달라질 수 있다.
  • 다국어 안전성 점수의 하락은 모델과 평가 도구 양쪽에서 발생할 수 있어, 원인을 분리하는 측정이 해석의 핵심이다.
  • 벤치마크의 신뢰성은 시험 간 결과의 일치뿐 아니라, 특정 의사결정을 뒷받침하고 실제 환경의 행동을 예측하는지까지 확인해야 한다.

✅ 액션 아이템

  • AI 벤치마크의 능력 비교에 앞서 수렴 타당도·변별 타당도 검증 여부를 확인할 필요가 있다.
  • BBQ와 다국어 안전성 평가의 점수를 해석할 때 독해 능력 및 번역에 따른 문항 의미·난도 변화를 분리해 검토할 필요가 있다.
  • 투자·규제·조달에 사용하는 벤치마크 점수의 판단 근거를 확인하고, 실제 환경의 행동에 대한 예측을 기록해 사후 대조할 필요가 있다.

❓ 열린 질문

  • 56개 벤치마크에서 발견된 측정 불일치는 각 시험의 능력 비교와 순위 해석에 어떤 영향을 미치는가?
  • 다국어 안전성 평가에서 실제 안전장치 약화와 번역에 따른 문항 의미·난도 변화의 기여도를 어떻게 구분할 수 있는가?
  • 투자·규제·조달에 쓰이는 벤치마크 점수가 실제 환경의 행동을 예측하는지 어떤 기준으로 검증할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.