Articlehuggingface.co·2026년 8월 28일·0

The Open ASR Leaderboard Adds Its First Global South Language

Quick Summary

Voice Arena와 Hugging Face가 Open ASR Leaderboard에 힌디어·인도 영어 평가 세트 Monsoon을 도입해 언어 범위를 넓히고 화자·지역·기기별 음성 인식 성능 차이를 분석할 기반을 마련했다.

The Open ASR Leaderboard Adds Its First Global South Language 관련 대표 이미지

🖼️ 인포그래픽

The Open ASR Leaderboard Adds Its First Global South Language 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The Open ASR Leaderboard Adds Its First Global South Language의 핵심 내용을 4단계로 요약한 인포그래픽
The Open ASR Leaderboard Adds Its First Global South Language 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Voice Arena와 Hugging Face가 Open ASR Leaderboard에 힌디어·인도 영어 평가 세트 Monsoon을 도입해 언어 범위를 넓히고 화자·지역·기기별 음성 인식 성능 차이를 분석할 기반을 마련했다.

📌 핵심 요약

  • Open ASR Leaderboard에 Monsoon en-IN과 Monsoon hi-IN이 추가됐으며, 5억 명 이상이 사용하는 힌디어는 기존에 유럽 언어만 포함했던 다국어 탭의 첫 인도계 언어다.
  • 두 언어는 각각 공개·비공개 평가 세트로 제공되며, 네 세트의 화자는 서로 겹치지 않고 총 4,888명이다. 공개 세트는 자체 평가에 활용할 수 있고, 비공개 세트는 벤치마크에 특화된 최적화를 제한한다.
  • Monsoon은 지리·연령·성별·어휘·기기·음향 환경·발화 유형·발화 속도·복수의 유효한 전사라는 아홉 축을 고려해 설계됐으며, 세그먼트당 18개 열 중 12개가 메타데이터다.
  • 세트별 기기 모델은 315~582종이며, 어떤 세트에서도 단일 모델의 세그먼트 비중은 2.1%를 넘지 않는다. 전체 화자의 절반 이상이 세그먼트 하나만 제공해 특정 화자에 대한 집중도를 낮췄다.
  • 인도 영어는 일반 문자열 정답과 정규화를 사용하고, 힌디어는 허용되는 표기 변형을 담은 래티스를 제공한다. 수집 과정에서는 언어·성별·실제 자발적 대화 여부·음질을 확인하고 자연스러운 환경 소음은 보존했다.

🧩 주요 포인트

  1. 단일 단어 오류율만으로 집단별 격차를 파악하기 어렵다는 한계 → Monsoon의 화자·지역·기기 메타데이터로 성능을 세분화해 분석할 기반 확보.
  2. 총 4,888명의 서로 겹치지 않는 화자와 낮은 화자·기기 집중도 → 녹음 시간 확대보다 다양한 목소리와 실제 사용 조건의 포괄에 무게를 둔 평가 설계.
  3. 힌디어의 복수 표기와 공개·비공개 평가 세트 병행 → 정답 표기의 다양성을 인정하면서 벤치마크에 특화된 최적화를 제한하는 평가 구조.

🧠 상세 정리

1. 평가 지표의 신뢰성과 집단별 격차

원문은 벤치마크가 모델의 채택과 개선 방향을 좌우하며, 측정되지 않는 능력은 개선의 관심에서 벗어나기 쉽다는 문제의식으로 시작한다. Open ASR Leaderboard는 비공개 평가 분할, 음성 자체보다 참조 전사를 재현하는 정도를 살피는 분석, 올바른 표기 변형이 감점되지 않도록 하는 정규화 보완을 추진해 왔다. 이런 조치는 단어 오류율인 WER을 평가에 유리하게 맞추기 어렵게 하지만, 하나의 수치만으로 사용자 집단 간 차이를 드러내지는 못한다. 인용된 기존 연구에서는 상용 시스템의 흑인 화자 오류율이 백인 화자보다 대략 두 배 높았으며, 성별·연령·억양에 따른 차이도 보고됐다. 원문은 기존 시험 자료가 발화 내용은 기록하면서 화자의 특성은 거의 담지 않는 점을 이러한 분석의 제약으로 지적한다.

2. 힌디어와 인도 영어 평가의 도입

Voice Arena와 Hugging Face는 이러한 공백을 줄이기 위해 Monsoon en-IN과 Monsoon hi-IN을 Open ASR Leaderboard에 도입했다. 힌디어는 5억 명 이상이 사용하는 언어이며, 기존에 유럽 언어만 다루던 다국어 탭에 처음 포함되는 인도계 언어다. 각 언어는 이용자가 자체 점수를 계산할 수 있는 공개 세트와 벤치마크에 특화된 최적화를 제한하기 위해 공개하지 않는 비공개 세트로 나뉜다. 네 세트에는 총 4,888명의 화자가 참여하며, 세트 사이에 동일한 화자가 중복되지 않도록 구성됐다. 이번 확장의 핵심은 평가 언어를 추가하는 동시에 화자 속성을 함께 제공해, 평균 오류율에 가려진 차이를 살필 수 있는 자료를 공개 평가에 연결하는 데 있다.

3. 아홉 가지 변이 축에 맞춘 수집 설계

Monsoon은 쉽게 확보할 수 있는 음성을 모으는 방식보다 평가에서 드러내야 할 차이를 먼저 정하는 방식으로 설계됐다. 변이 축은 지리, 연령, 성별, 어휘, 기기, 음향 환경, 발화 유형, 발화 속도, 동일한 음성에 대한 복수의 유효한 전사로 구성된다. 지역적 다양성은 소수 지역에서 긴 대화를 녹음하는 대신 수백 개 지구에서 참여자를 모집해 확보했고, 기기와 음향 조건은 참여자가 실내외에서 자신의 휴대전화와 연결 환경을 사용하도록 해 반영했다. 일상 주제에 대한 의견, 반대, 이야기, 회상을 유도하는 질문은 고유명사와 숫자, 준비되지 않은 표현이 나타나도록 구성됐으며, 연령과 성별은 화자별로 기록하고 검증했다. 복수의 유효한 전사는 녹음 조건이 아니라 정답 표현의 문제로 구분되며, 이러한 설계는 평균 점수가 양호해도 특정 집단에서는 성능이 떨어질 수 있다는 점을 겨냥한다.

4. 네 평가 세트의 규모와 정답 표현

인도 영어 공개 세트는 5.62시간·1,444명, 비공개 세트는 5.58시간·1,405명으로 구성되며, 두 세트 모두 클립의 평균 길이는 9.6초다. 힌디어 공개 세트는 1.33시간·468명, 비공개 세트는 4.47시간·1,571명이고 평균 클립 길이는 각각 6.4초와 6.6초다. 자료는 대본 없는 두 사람의 자발적 대화를 이중 채널로 수집한 뒤 단일 채널에서 잘라, 각 클립에 한 화자의 발화가 담기도록 구성됐다. 인도 영어는 일반 문자열 정답을 제공하며 리더보드의 정규화기가 대부분의 철자 변형을 통합하지만, 힌디어의 변형은 두 표기 관례 사이의 고정 대응만으로 처리할 수 없다고 설명한다. 이에 힌디어는 전사 구간마다 정답으로 인정되는 철자 목록을 담은 래티스를 제공해, 같은 음성을 올바르게 적는 여러 방식을 평가에 반영한다.

5. 녹음 시간보다 화자와 기기의 분산

Monsoon은 녹음 시간으로 보면 작지만 화자 수로 보면 큰 자료이며, 원문은 이 선택을 데이터셋 가치의 핵심으로 설명한다. 화자당 평균 세그먼트 수는 1.46~1.61개이고, 전체 화자의 절반 이상이 정확히 한 개의 세그먼트만 제공해 소수의 긴 녹음이 점수를 좌우하는 구조를 줄였다. 기여량이 가장 큰 화자 10명이 차지하는 전체 녹음 시간의 비중도 세트별 2.8~6.8%에 머문다. 인도 영어 공개 세트는 428개 출신 지구와 30개 주·연방직할지를 포함하며, 힌디어 공개·비공개 세트도 각각 202개와 295개 지구를 포괄한다. 기기 모델은 세트별 315~582종이고 단일 모델의 세그먼트 비중이 2.1%를 넘지 않아, 다양한 목소리와 녹음 조건을 평가에 포함하도록 구성됐다.

6. 메타데이터가 여는 지역별 성능 분석

Monsoon은 세그먼트당 18개 열을 제공하며, 이 가운데 12개가 메타데이터로서 화자·배경·지리·기기 정보를 담는다. 성별과 생년월일 외에도 직업, 교육 배경, 혼인 상태, 소득 구간, 출신 지구와 주, 현재 도시, 현재 지구 거주 연수, 기기 제조사와 모델이 포함되며, 참여자는 해당 사용에 동의했다. 힌디어 세트에서는 우타르프라데시 출신이 화자의 약 40%를 차지하지만, 인도 영어에서는 어느 주도 13%를 넘지 않고 약 3분의 1이 상위 8개 주 밖에서 온다. 원문은 인도의 주 경계가 언어를 따라 형성됐기 때문에 지구와 주 정보가 억양 분석에 의미가 있으며, 공개·비공개 세트의 지리적 분포도 서로 가깝다고 설명한다. 기존 비공개 인도 음성 인식 평가에서 지구별 오류율이 약 4~44%로 벌어진 사례를 제시하면서, Monsoon이 공개 리더보드에서도 이와 같은 세분 분석을 가능하게 한다고 강조한다.

7. 분산 모집과 자발적 대화 유도

참여자는 농촌과 준도시 지역까지 접근하는 Voice Arena 커뮤니티를 통해 모집됐고, 언어 숙련도 심사를 통과한 뒤 녹음에 참여했다. 두 사람이 지정된 일상 주제를 바탕으로 개인 간 연결 인터페이스에서 대화했으며, 자신의 휴대전화와 통신 연결을 사용했기 때문에 저사양 기기와 불안정한 대역폭의 영향도 자료에 반영됐다. 참여자는 보상을 받고 학습 및 배포 목적의 이용에 대해 충분한 설명에 기반한 동의를 제공했으며, 언어별 인구 규모와 지리적 분포를 고려한 화자당 녹음 시간 상한이 적용됐다. 짧고 빈약한 응답을 줄이기 위해 개방형 서사 질문과 단계적으로 제시되는 후속 질문을 사용했고, 여행·의료·농업·교육·디지털 서비스 등의 주제로 대화를 확장했다. 후보 주제는 대규모 언어 모델로 생성한 뒤 원어민 언어학자가 검토하고 현지화해, 대본을 읽게 하지 않으면서도 충분한 설명을 유도하도록 구성했다.

8. 품질 검증과 실제 녹음 환경의 보존

분산 수집에서는 과제 수행을 가장하거나 녹음된 음성을 재생해 제출하는 등의 문제가 발생할 수 있어, 모든 녹음은 전사 전에 여러 검증을 거쳤다. 발화 언어는 30개 이상 언어의 사람이 주석을 단 데이터로 학습한 언어 식별 모델을 사용해 지정 언어와 일치하는지 확인했다. 성별 분류기는 화자의 자기 보고를 대체하는 수단이 아니라 보조 확인 수단으로 사용됐고, 별도 모델은 실제 자발적 대화와 사전 녹음 또는 재생 음성을 구분했다. 신호 대 잡음비 추정으로 알아듣기 어려울 정도로 손상된 녹음은 제외했지만, 자연스러운 배경 소음은 실제 환경의 음향 특성을 유지하기 위해 보존했다. 검증을 통과한 녹음에는 음성 활동 감지에 따른 분할이 적용됐으며, 제공된 원문은 연속 2초 침묵과 15초 기준을 설명하던 문장 중간에서 끝나므로 이후 전사·검수 절차는 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 평가 언어를 늘리는 것과 화자 정보를 풍부하게 제공하는 것은 서로 다른 공백을 메운다. Monsoon은 힌디어를 추가하면서 기존 평균 점수로 보기 어려운 집단별 차이를 분석할 기반도 제공한다.
  • 녹음 시간이 비슷하더라도 화자와 기기의 집중도에 따라 평가가 반영하는 범위는 달라진다. Monsoon의 설계는 긴 녹음을 제공하는 소수보다 다양한 참여자의 짧은 발화에 무게를 둔다.
  • 음성 인식 평가의 신뢰성은 모델의 오류뿐 아니라 정답 표현 방식에도 달려 있다. 힌디어의 래티스는 허용 가능한 표기 차이를 오인식으로 취급하지 않기 위한 장치다.

✅ 액션 아이템

  • Monsoon 공개 세트를 활용한 자체 음성 인식 성능 평가 진행.
  • 화자·지역·기기 메타데이터를 활용해 단일 단어 오류율에 가려진 집단별 성능 차이 분석.
  • 힌디어 평가에서 래티스의 허용 표기 변형이 정답 판정에 반영되는지 확인.

❓ 열린 질문

  • Monsoon에서 화자·지역·기기별로 성능을 나누어 보면 단일 단어 오류율에 가려진 차이는 얼마나 나타나는가?
  • 힌디어의 허용 표기 변형을 래티스로 반영하면 정답 판정과 단어 오류율은 어떻게 달라지는가?
  • 공개·비공개 평가 세트의 결과를 비교하면 벤치마크에 특화된 최적화의 영향을 어느 정도 확인할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.