Articlehuggingface.co·2025년 10월 20일·1

Introducing the Open Leaderboard for Japanese LLMs!

Quick Summary

LLM jp와 허깅페이스가 일본어의 복합적인 언어 특성을 반영한 16개 과제와 20개 이상의 데이터셋으로 개방형 일본어 대규모 언어 모델을 비교·분석하는 공개 리더보드를 구축했다.

Introducing the Open Leaderboard for Japanese LLMs! 관련 대표 이미지

🖼️ 인포그래픽

Introducing the Open Leaderboard for Japanese LLMs! 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing the Open Leaderboard for Japanese LLMs!의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing the Open Leaderboard for Japanese LLMs! 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

LLM-jp와 허깅페이스가 일본어의 복합적인 언어 특성을 반영한 16개 과제와 20개 이상의 데이터셋으로 개방형 일본어 대규모 언어 모델을 비교·분석하는 공개 리더보드를 구축했다.

📌 핵심 요약

  • 일본어는 한자·히라가나·가타카나·로마자·외래어·여러 숫자 표기와 이모티콘이 혼재하고 단어 사이의 공백도 없어, 토큰화와 언어 이해가 특히 어려운 언어다.
  • 개방형 일본어 대규모 언어 모델 리더보드는 LLM-jp와 허깅페이스가 일본어 모델 연구의 투명성, 비교 가능성, 국제 협력과 오픈소스 개발을 촉진하기 위해 마련했다.
  • 평가는 llm-jp-eval을 통해 자연어 추론, 번역, 요약, 질의응답, 코드 생성, 수학 추론, 시험 문제 등 16개 과제를 4개 예시가 주어진 조건에서 수행한다.
  • 평가 결과 개방형 구조 기반 일본어 모델은 일반 언어 처리에서 폐쇄형 모델과의 격차를 줄이고 있지만, 금융 감성 분석, 언어 주석, 코드 생성, 요약 같은 전문 과제는 여전히 어렵게 나타났다.
  • 향후에는 일본어 평가 데이터셋을 확대하고, 사고 과정 유도 프롬프트의 효과를 비교하며, 주어진 선택지 밖의 답을 생성하는 비율을 측정하는 새로운 지표를 지원할 예정이다.

🧩 주요 포인트

  1. 일본어는 한자·히라가나·가타카나·로마자·외래어·여러 숫자 표기와 이모티콘이 혼재하고 단어 사이의 공백도 없어, 토큰화와 언어 이해가 특히 어려운 언어다.
  2. 개방형 일본어 대규모 언어 모델 리더보드는 LLM-jp와 허깅페이스가 일본어 모델 연구의 투명성, 비교 가능성, 국제 협력과 오픈소스 개발을 촉진하기 위해 마련했다.
  3. 평가는 llm-jp-eval을 통해 자연어 추론, 번역, 요약, 질의응답, 코드 생성, 수학 추론, 시험 문제 등 16개 과제를 4개 예시가 주어진 조건에서 수행한다.
  4. 평가 결과 개방형 구조 기반 일본어 모델은 일반 언어 처리에서 폐쇄형 모델과의 격차를 줄이고 있지만, 금융 감성 분석, 언어 주석, 코드 생성, 요약 같은 전문 과제는 여전히 어렵게 나타났다.
  5. 향후에는 일본어 평가 데이터셋을 확대하고, 사고 과정 유도 프롬프트의 효과를 비교하며, 주어진 선택지 밖의 답을 생성하는 비율을 측정하는 새로운 지표를 지원할 예정이다.

🧠 상세 정리

1. 일본어 모델 평가가 필요한 배경

대규모 언어 모델의 영어 능력은 빠르게 향상되고 있지만, 고유한 언어 구조를 지닌 각국 언어에서의 성능은 일관되게 파악하기 어렵다. 일본어는 한자, 히라가나, 가타카나를 함께 사용하며 로마자와 네덜란드어·포르투갈어·프랑스어·영어·독일어에서 들어온 외래어, 아라비아 숫자와 전통 중국식 숫자 표기까지 혼합한다. 여기에 키릴 문자나 그리스 문자를 활용한 가오모지와 일본의 휴대전화 문화에서 대중화된 이모지 같은 디지털 표현도 널리 쓰인다. 특히 일본어는 단어 사이에 공백을 두지 않기 때문에 언어 단위의 경계를 찾아내는 토큰화 과정이 매우 어렵다. 일본의 대학 연구실, 인공지능 신생 기업, 대기업 연구개발 조직이 이러한 특성을 반영한 모델을 개발해 왔지만, 서로 다른 모델을 중앙에서 공개적으로 비교할 체계는 부족했다.

2. 개방형 일본어 리더보드의 목적과 구성

개방형 일본어 대규모 언어 모델 리더보드는 일본어 모델의 내부 능력을 여러 각도에서 파악할 수 있도록 고전적인 자연어 처리 과제부터 현대적인 추론 과제까지 20개 이상의 데이터셋을 모은 평가 체계다. 이 리더보드는 일본어 대규모 언어 모델 연구개발을 수행하는 조직 횡단 프로젝트 LLM-jp가 허깅페이스와 협력해 구축했다. 두 조직은 평가 결과와 절차를 공개함으로써 일본어 모델 연구의 투명성을 높이고, 개방형 모델 개발 문화를 장려하는 것을 목표로 한다. 또한 일본 연구자뿐 아니라 국제 연구자도 같은 기준에서 모델을 평가하고 결과를 비교하며 개선 작업에 참여할 수 있는 협업 기반을 제공하려 한다. 따라서 리더보드는 단순한 순위표라기보다 일본어 모델의 강점과 한계를 공통된 평가 자료로 조사하는 공개 연구 플랫폼으로 제시된다.

3. 16개 평가 과제와 데이터셋 구축 방식

리더보드는 일본어 특화 평가 도구인 llm-jp-eval을 사용해 총 16개 과제를 평가하며, 각 과제는 네 개의 예시를 제공하는 조건으로 실행된다. 평가 범위에는 자연어 추론, 기계 번역, 요약, 질의응답 같은 전통적인 과제와 코드 생성, 수학적 추론, 사람을 대상으로 한 시험 문제 같은 현대적인 과제가 함께 포함된다. 데이터셋은 LLM-jp 평가팀이 언어학자, 분야 전문가, 사람 주석자와 함께 처음부터 제작하거나, 기존 자료를 일본어로 자동 번역한 뒤 일본어의 언어적·문화적 특성에 맞게 조정했다. 일부 데이터셋은 긴 문맥을 읽고 여러 정보를 연결해야 답할 수 있도록 구성되어 단순한 문장 수준의 처리를 넘어선 추론 능력도 확인한다. 원문은 전체 과제 가운데 여덟 개 데이터셋의 예시와 용도를 소개하며, 나머지 세부 정보는 리더보드의 소개 화면과 각 데이터셋의 공식 링크에서 확인하도록 안내한다.

4. 시간 추론·다단계 질의응답·상식·금융 감성 평가

Jamp는 다양한 시간적 관계가 포함된 영어와 일본어 문장 쌍을 사용해 함의, 중립, 모순을 판별하는 일본어 시간 추론 벤치마크이며, 모델의 일반화 능력을 조사한다. JEMHopQA는 질문을 입력받아 답변뿐 아니라 그 답에 이르는 도출 과정도 생성하게 하는 일본어 다단계 질의응답 데이터셋으로, 여러 정보를 연결하는 내부 추론 능력을 평가한다. jcommonsenseqa는 CommonsenseQA를 일본어로 구성한 객관식 질의응답 데이터셋으로, 모델이 일상적인 상식에 근거해 적절한 답을 고를 수 있는지 측정한다. chABSA는 2016회계연도 일본 상장기업의 재무 보고서를 바탕으로 개체, 속성, 감성의 조합을 주석한 측면 기반 감성 분석 자료다. 이 데이터셋에는 일본 상장기업 2,260곳 가운데 약 10퍼센트인 230곳이 일본 금융청의 분류 체계에 따라 주석되어 있어 금융 분야의 세부적인 언어 이해 능력을 확인한다.

5. 코드·수학·지식·요약 능력 평가

mbpp-ja는 기본적인 파이썬 프로그래밍 문제로 이루어진 MBPP를 LLM-jp가 DeepL을 활용해 영어에서 일본어로 번역한 코드 생성 데이터셋이다. mawps는 수학 문장제 저장소인 MAWPS를 기반으로 하며, 사람 이름과 단위, 장소를 일본 문화에 맞게 바꾸고 덧셈·뺄셈·다단계 산술·한두 개의 방정식을 단계적으로 해결하는 능력을 평가한다. JMMLU는 고등학교 수준의 지식을 다루는 MMLU 일부를 일본어로 번역한 네지선다형 자료로, 천문학·화학·사회학·국제법 등 57개 분야를 포함하고 일본의 공민·지리·관용 표현처럼 고유한 문화 맥락도 반영한다. XL-Sum은 44개 언어를 대상으로 한 다국어 추상 요약 연구의 일본어 자료로, 일본어로 번역된 BBC 뉴스의 제목, 기사 전문, 요약문으로 구성된다. 기사 주제는 국제 현안, 정치, 기술, 스포츠, 문화에 걸쳐 있어 모델이 다양한 분야의 긴 글에서 핵심 내용을 추려내는 능력을 측정한다.

6. 자동화된 평가의 기술적 구성

리더보드의 전체 구성은 기존 개방형 대규모 언어 모델 리더보드에서 영감을 받았으며, 제출된 모델을 동일한 절차로 배포하고 평가하도록 자동화되어 있다. 모델이 제출되면 허깅페이스의 추론 엔드포인트를 통해 자동으로 배포되고, 일본어 평가 라이브러리 llm-jp-eval 1.14.1 버전으로 과제별 성능을 측정한다. 추론과 모델 제공에는 메모리를 효율적으로 사용하는 vLLM 0.6.3 버전이 사용되어 여러 모델을 공통 환경에서 실행할 수 있도록 한다. 실제 평가 계산은 일본 연구를 위한 고성능 컴퓨팅 플랫폼인 mdx의 후방 시스템에서 처리된다. 이러한 구성은 제출부터 실행과 점수 산출까지의 흐름을 표준화해, 서로 다른 일본어 모델의 결과를 같은 평가 체계에서 공개적으로 비교할 수 있게 한다.

7. 초기 평가에서 드러난 모델 성능과 과제

일본어 모델 안내 자료인 Awesome Japanese LLM에 따르면 많은 일본 인공지능 연구소가 메타의 Llama 개방형 구조를 선호하지만, 미스트랄의 Mistral과 알리바바의 Qwen도 일본 개방형 모델 공동체에서 성공적으로 활용되었으며 리더보드 상위 점수로 이어졌다. 일반 언어 처리 과제에서는 개방형 구조를 기반으로 한 일본어 모델이 폐쇄형 모델과의 성능 격차를 줄이는 모습이 관찰되었다. LLM-jp가 개발하고 대학 지원금으로 연구한 llm-jp-3-13b-instruct는 폐쇄형 모델과 비슷한 수준의 성능에 도달한 사례로 제시된다. 반면 금융 분야의 chABSA, 언어 주석을 다루는 위키백과 주석 말뭉치, 코드 생성용 mbpp-ja, 요약용 XL-Sum은 대부분 모델에 여전히 어려운 과제로 남아 있다. 일본 기업이나 연구소에서 나온 모델은 일본의 가치관을 기준으로 윤리적 딜레마에서 선택하는 능력을 평가하는 JCommonsenseMorality에서 상대적으로 더 높은 점수를 보였다.

8. 평가 체계의 향후 확장 방향과 협력 기반

리더보드는 일본어 모델의 지속적인 발전을 반영하기 위해 llm-jp-eval의 변화에 맞춰 평가 범위와 기능을 계속 확장할 계획이다. 데이터셋 측면에서는 코드 생성 능력을 평가하는 HumanEval의 일본어판 JHumanEval과 대규모 다중 과제 언어 이해 평가인 MMLU를 추가하는 작업이 진행되고 있다. 평가 방식으로는 사고 과정 유도 프롬프트를 사용했을 때와 기본 프롬프트를 사용했을 때의 성능을 비교해 모델 행동을 더 세밀하게 이해하려 한다. 또한 자연어 추론처럼 정해진 답안 표지가 있는 과제에서 모델이 제시된 선택지 밖의 토큰을 얼마나 자주 생성하는지 측정하는 선택지 이탈률을 도입해 지시 준수 능력을 평가할 예정이다. 이 사업은 LLM-jp가 구축하고 일본 국립정보학연구소와 mdx 프로그램이 지원했으며, 도쿄대학교 연구진과 허깅페이스 관계자들이 과학 자문과 평가 프레임워크 통합 및 맞춤화에 참여했다.

🧾 핵심 주장 / 시사점

  • 이 리더보드는 일본어 모델을 하나의 종합 점수로만 비교하지 않고, 시간 추론·상식·금융 감성·코드·수학·지식·요약처럼 성격이 다른 과제를 함께 평가해 모델별 강점과 취약 영역을 구분할 수 있게 한다.
  • 개방형 구조 기반 모델이 일반 언어 처리에서는 폐쇄형 모델과의 격차를 줄였지만 전문 데이터와 생성 과제에서는 어려움이 남았다는 결과는, 전체 평균 점수와 과제별 성능을 함께 살펴야 한다는 점을 보여준다.
  • 사고 과정 유도 프롬프트 비교와 선택지 이탈률의 도입은 정답률뿐 아니라 추론 방식의 변화와 지시 준수 여부까지 평가하려는 확장으로, 일본어 모델의 행동을 더 세밀하게 분석하려는 방향을 드러낸다.

✅ 액션 아이템

  • 일본어 리더보드의 16개 과제와 20개 이상 데이터셋 기반으로 비교 기준을 정리하고 LLM-jp-eval 평가 구성을 고정한다.
  • llm-jp-eval의 4개 예시 조건에서 자연어 추론·번역·요약·Q&A·코드 생성·수학 추론·시험 항목 성능을 과제별로 재확인한다.
  • 개방형 구조 모델의 일반 NLP 개선 효과와 금융 감성 분석·언어 주석·코드 생성·요약의 약점을 분리해 성능 분포를 정리한다.

❓ 열린 질문

  • 개방형 모델의 일반 언어 처리 성능 향상은 과제별로 얼마나 크고, 어느 영역에서 닫힌 모델과의 격차가 남는가?
  • 일본어의 다중 문자 체계·공백 부재·이모티콘 혼재가 토크나이제이션 오류를 유발한 비중을 어느 방식으로 추정할 것인가?
  • 선택지 외 답변 비율 지표를 추가하면 기존 벤치마크 점수와 어떤 방식으로 충돌하거나 보완 관계를 형성할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.