The Open Arabic LLM Leaderboard 2
Quick Summary
오픈 아랍어 LLM 리더보드 2는 기존 평가의 번역 편향·포화·검증 오류를 바로잡고, 아랍어 고유 특성과 실제 활용을 반영한 원어·인간 검수 벤치마크와 생성형 평가를 확대한 개편판이다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
오픈 아랍어 LLM 리더보드 2는 기존 평가의 번역 편향·포화·검증 오류를 바로잡고, 아랍어 고유 특성과 실제 활용을 반영한 원어·인간 검수 벤치마크와 생성형 평가를 확대한 개편판이다.
📌 핵심 요약
- 기존 아랍어 LLM 리더보드는 평가에 필요한 연산 자원을 개별 이용자에게 전가하거나 자체 제출 점수를 그대로 게시해, 접근성과 결과 신뢰성을 충분히 보장하지 못했다.
- 2024년 5월 출범한 첫 오픈 아랍어 LLM 리더보드는 약 7개월 동안 180개 이상의 조직으로부터 700개가 넘는 모델을 접수하며 아랍어 AI 공동체의 핵심 평가 플랫폼으로 성장했다.
- 첫 버전에는 영어권 과제를 직접 번역한 데이터와 변별력이 떨어진 포화 벤치마크가 포함됐고, AlGhafa 과제의 선택지 판정 오류는 특히 작거나 성능이 낮은 모델의 순위에 큰 영향을 주었다.
- 두 번째 버전은 포화되거나 기계 번역된 과제를 제거하고, 원어 아랍어 MMLU·인간 번역 MMLU·MedinaQA·AraTrust 등 원어 또는 인간 검수 중심의 데이터셋을 추가했다.
- 새로 도입된 ALRAGE는 아랍어 도서 40권에서 구축한 자료와 LLM 심사자 기반의 0~10점 평가 방식을 활용해, 아랍어 검색 증강 생성 능력을 정확성·관련성·응답 품질 측면에서 재현 가능하게 측정한다.
🧩 주요 포인트
- 기존 아랍어 LLM 리더보드는 평가에 필요한 연산 자원을 개별 이용자에게 전가하거나 자체 제출 점수를 그대로 게시해, 접근성과 결과 신뢰성을 충분히 보장하지 못했다.
- 2024년 5월 출범한 첫 오픈 아랍어 LLM 리더보드는 약 7개월 동안 180개 이상의 조직으로부터 700개가 넘는 모델을 접수하며 아랍어 AI 공동체의 핵심 평가 플랫폼으로 성장했다.
- 첫 버전에는 영어권 과제를 직접 번역한 데이터와 변별력이 떨어진 포화 벤치마크가 포함됐고, AlGhafa 과제의 선택지 판정 오류는 특히 작거나 성능이 낮은 모델의 순위에 큰 영향을 주었다.
- 두 번째 버전은 포화되거나 기계 번역된 과제를 제거하고, 원어 아랍어 MMLU·인간 번역 MMLU·MedinaQA·AraTrust 등 원어 또는 인간 검수 중심의 데이터셋을 추가했다.
- 새로 도입된 ALRAGE는 아랍어 도서 40권에서 구축한 자료와 LLM 심사자 기반의 0~10점 평가 방식을 활용해, 아랍어 검색 증강 생성 능력을 정확성·관련성·응답 품질 측면에서 재현 가능하게 측정한다.
🧠 상세 정리
1. 기존 아랍어 LLM 평가 환경의 한계
아랍어를 지원하는 단일 언어 및 다국어 LLM이 늘어나면서 아랍어 전용 리더보드도 등장했지만, 초기 평가 체계는 특정 논문이나 데이터셋을 시연하는 좁은 범위에 머무는 경우가 많았다. 다른 형태의 리더보드는 이용자가 자신의 연산 자원으로 모델을 평가한 뒤 결과가 담긴 JSON 파일을 제출하도록 했기 때문에, 모든 공개 모델을 동일한 조건에서 비교하기 어려웠다. 상당한 시간과 연산 비용을 감당할 수 없는 공동체 구성원은 모델 제작자가 문서에 공개한 점수에 의존해야 했고, 서로 다른 평가 조건 때문에 직접 비교도 제한됐다. 또한 자체 제출된 점수가 실제 평가에서 생성됐는지 중앙에서 검증하는 장치가 부족해 결과의 정확성·공정성·신뢰성이 훼손될 가능성이 있었다. 이러한 문제는 누구나 접근할 수 있으면서도 평가 과정이 투명하고 재현 가능한 공동 벤치마킹 기반이 필요하다는 문제의식으로 이어졌다.
2. 2024년에 확장된 아랍어 평가 생태계
이러한 공백을 해소하기 위해 2A2I, TII, 허깅페이스는 2024년 5월 첫 오픈 아랍어 LLM 리더보드를 공개하고 독해·감성 분석·질의응답 등을 포함한 14개 벤치마크를 제공했다. 같은 해 9월 SDAIA와 킹 살만 세계 아랍어 아카데미가 발표한 발삼 인덱스는 약 1,400개 데이터셋과 5만 개 질문으로 문법 교정, 바꿔쓰기, 인과관계 분류, 텍스트 이해 등 67개 과제를 다뤘다. 12월 5일에는 인셉션과 MBZUAI가 원어 아랍어와 문화적 맥락을 고려한 생성 과제 데이터셋 및 동적 비공개 평가 주기를 사용하는 AraGen 리더보드를 발표했다. 이어 12월 19일에는 스케일의 SEAL 연구소가 다국어 리더보드의 일부로 아랍어 평가를 공개했으며, 비공개 벤치마크와 인간 선호 평가를 이용해 복잡하고 문화적으로 미묘한 대화를 다뤘다. 이 흐름은 아랍어 평가가 단순한 객관식 과제에서 원어성, 문화적 적합성, 생성 능력과 인간 선호까지 포괄하는 방향으로 확대됐음을 보여준다.
3. 첫 번째 리더보드가 거둔 참여 성과
첫 오픈 아랍어 LLM 리더보드는 출시 후 7개월이 채 지나지 않아 방문자 4만 6천 명 이상을 기록했고, 2025년 1월 한 달에도 2천 회가 넘는 방문을 받았다. 허깅페이스 스페이스는 100개 이상의 좋아요와 구글 스칼라 기준 8회의 인용을 확보했으며, 공동체는 10억 개부터 700억 개 초과 규모까지 700개가 넘는 모델을 제출했다. 제출 모델은 180개 이상의 서로 다른 조직에서 나와, 이 리더보드를 매우 활발한 LLM 평가 플랫폼 가운데 하나로 만들었다. 모델 유형별로는 채팅 및 미세조정 모델이 전체의 70% 이상을 차지한 반면 사전학습 모델은 11%에 불과했고, 크기별로는 70억 개 미만 매개변수 모델이 절반을 넘었다. 운영 기간 대비 평가 모델 수에서도 한국어·폴란드어·포르투갈어 리더보드의 뒤를 근접하게 따랐으며, 온라인 아랍어 콘텐츠가 상대적으로 제한적이라는 조건을 고려하면 참여 규모의 의미가 더욱 컸다.
4. 새 리더보드가 필요해진 이유
공동체의 비판과 논의를 통해 기존 리더보드에는 아랍어에 특화된 직접 평가, 벤치마크 제작 과정의 투명성, 방언·분야·실제 사용 사례를 반영하는 데이터 다양성이 부족하다는 점이 드러났다. 아랍어는 복잡한 문법과 풍부한 형태론, 다양한 구어 방언, 문화적 맥락에 민감한 안전 문제를 지니므로 일반적인 자연어 처리 과제만으로 실제 역량을 충분히 측정하기 어렵다. 첫 OALL의 상당수 과제는 비아랍어권 맥락에서 만들어졌고, 영어 과제를 직접 번역하는 과정에서 언어적·문맥적 불일치가 발생해 아랍어 고유의 형태·통사적 복잡성을 제대로 반영하지 못했다. 일부 벤치마크는 모델 점수가 거의 완벽한 수준에 도달해 작은 성능 개선을 구분하는 변별력도 잃었다. 이에 두 번째 버전은 실제 아랍어 사용 환경에 더 가까운 원어 과제를 채택하고, 이미 포화된 평가를 더 최신성 있고 관련성 높은 과제로 교체하는 방향으로 설계됐다.
5. AlGhafa 오류와 평가 공정성 문제
개편 과정에서는 첫 버전의 핵심 과제 중 하나인 AlGhafa에서 모델 순위에 영향을 준 조용한 오류도 확인됐다. 정답을 판정할 때 선택지의 인덱스를 확인해야 했지만 실제 구현은 선택지 내용 자체를 기준으로 응답을 검사했고, 이 방식이 완전히 틀린 것은 아니었어도 모델별 영향을 균등하게 만들지는 못했다. 강한 모델은 비교적 영향을 적게 받은 반면 작거나 성능이 낮은 모델은 불균형한 손해를 입었으며, 일부 모델은 점수가 최대 20점까지 하락했다. 그 결과 같은 기준으로 모델을 비교해야 하는 평가의 일관성·공정성·통일성이 훼손되고 순위의 신뢰성에도 문제가 생겼다. 이 사례는 벤치마크 데이터의 품질뿐 아니라 정답 판정 로직과 실행 절차까지 검증해야 재현 가능한 리더보드를 만들 수 있음을 보여주는 개편의 직접적인 근거가 됐다.
6. 개편 원칙과 유지된 아랍어 원어 과제
두 번째 리더보드는 포화된 과제와 기계 번역 과제를 제거하고, 새롭게 공개된 고품질 원어 또는 인간 검수 벤치마크를 추가한다는 두 가지 원칙을 따른다. 기계 번역 과제는 원천적인 품질 저하와 문화적 편향 가능성이 있고, 포화된 과제는 모델 간 차이를 더 이상 유효하게 구분하지 못하기 때문이다. 기존 AlGhafa에서는 전체를 그대로 유지하지 않고 사람이 검수한 Facts-Balanced, SOCAL, XGLUE, Sentiment와 여러 감성 평점 과제 등 원어 아랍어 데이터만 선별했다. 여기에 메타의 Belebele에서 아랍어 현대 표준어 및 아랍어 방언 과제를 보존하고, Arabic EXAMS 벤치마크도 유지했다. 이러한 선별은 첫 리더보드의 성과를 모두 폐기하는 대신, 아랍어 고유 표현을 직접 담고 품질 관리 근거가 있는 과제만 계승해 평가의 연속성과 타당성을 함께 확보하려는 조치다.
7. 새롭게 추가된 지식·문법·안전 벤치마크
개편판에는 최근 1년 동안 공개된 여러 데이터셋이 추가돼 평가 범위가 크게 넓어졌다. MBZUAI의 원어 아랍어 MMLU는 영어 MMLU에서 착안했지만 현대 표준 아랍어 학교 시험에서 직접 수집한 약 1만 5천 개 객관식 문항과 40개 과제로 구성돼, 번역 과제와 다른 원어 기반 지식 평가를 제공한다. 인셉션이 JAIS 프로젝트의 일부로 검수한 인간 번역 MMLU는 원래 영어 MMLU의 57개 과제를 사람이 번역해 기계 번역의 한계를 줄였다. MBZUAI가 공개한 MedinaQA는 일반 아랍어 능력과 문법 요소를 집중적으로 다루며, AraTrust는 사람이 작성한 522개의 객관식 문항으로 안전성과 진실성의 여러 측면을 평가한다. 이 구성은 일반 지식 점수에만 집중하지 않고 원어 학업 지식, 문법, 안전, 진실성까지 나누어 모델의 아랍어 역량을 더 다면적으로 확인하도록 한다.
8. ALRAGE의 아랍어 검색 증강 생성 평가
새 리더보드는 객관식 평가를 넘어 아랍어 검색 증강 생성 능력을 측정하기 위해 ALRAGE 벤치마크를 도입했다. 데이터는 예술·문학부터 기술·혁신까지 다양한 주제를 다룬 아랍어 도서 40권에서 선별됐고, 메타 라마 3.1 70B 모델로 합성 생성한 뒤 Argilla 공동체 작업을 통해 아랍어 원어민이 검증했다. 각 항목은 질문, 정답, BAAI의 bge-m3 임베딩 모델로 검색한 후보 문맥, 목표 후보 인덱스를 포함해 실제 아랍어 RAG 상황을 모사하도록 설계됐다. 평가는 lighteval 프레임워크 안에서 Qwen2.5 72B 인스트럭트 모델을 심사자로 사용하고, 구조화된 아랍어 프롬프트로 생성 응답과 정답을 비교한다. 심사자는 정확성·관련성·품질을 기준으로 0점부터 10점까지 평가하며, 결과는 표준화를 위해 0에서 1 사이로 정규화돼 아랍어의 언어적 뉘앙스에 민감하면서도 재현 가능한 생성 평가를 제공한다.
🧾 핵심 주장 / 시사점
- 첫 OALL의 700개 이상 모델과 180개 이상 참여 조직은 공용 평가 인프라가 개별 연구자의 연산 자원 부족과 비교 불가능한 자체 보고 점수 문제를 완화하는 데 실질적인 수요가 있었음을 보여준다.
- 두 번째 버전의 핵심 변화는 벤치마크 수를 단순히 늘리는 것이 아니라, 기계 번역·포화 과제를 제거하고 원어 제작·인간 검수·아랍어 고유 문법과 문화적 맥락을 평가 기준의 중심에 둔 것이다.
- AlGhafa 오류 수정과 ALRAGE의 구조화된 심사 방식은 신뢰할 수 있는 순위가 데이터 품질뿐 아니라 정답 판정 구현, 평가 절차의 일관성, 재현 가능한 생성 점수 체계에도 달려 있음을 드러낸다.
✅ 액션 아이템
- 영문 과제 번역 및 포화된 과제 비중을 낮추고 원어·인간 검수 중심 데이터셋으로 대체한다.
- 참가자 자체 제출 점수 단독 공개 구조를 보완해 독립 검증 점수를 함께 공개해 순위 신뢰도를 높인다.
- ALRAGE의 0~10점, 정확성·관련성·응답 품질 항목으로 1·2판 순위를 대조해 저성능 모델 변화를 점검한다.
❓ 열린 질문
- 영어 번역 과제 의존도를 어느 수준까지 낮추면 실제 순위 편향 완화가 입증되는가?
- AlGhafa 선택지 판정 오류가 어느 모델군에서 얼마나 크게 작동해 순위 왜곡을 유발했는가?
- ALRAGE에서 정확성·관련성·응답 품질 가중치는 동일할 때와 달리 둘 때 어떤 판단 차이가 생기는가?