AI for everyone in every language
Quick Summary
Google은 300개 이상의 언어를 지원하는 기술을 바탕으로, 음성의 감정·문화적 맥락을 이해하고 연결성·기기·접근성 제약을 줄이는 다언어 AI를 확대하고 있다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Google은 300개 이상의 언어를 지원하는 기술을 바탕으로, 음성의 감정·문화적 맥락을 이해하고 연결성·기기·접근성 제약을 줄이는 다언어 AI를 확대하고 있다.
📌 핵심 요약
- Google에 따르면 자사 기술과 제품은 세계 인구의 86%인 70억 명 이상이 사용하는 300개 이상의 언어를 지원하며, 2006년 출시한 Google Translate의 지원 언어는 현재 250개 이상으로 늘었다.
- Google은 음성을 직접 처리하는 AI를 개발하고 있으며, Gemini 3.5 Live Translate는 70개 언어와 2,000개 이상의 언어 쌍에서 실시간 통역을 지원한다. 세계에서 가장 많이 쓰이는 1,000개 언어 지원이 목표이며, Universal Speech Model은 1,200만 시간의 음성과 언어 간 전이 학습을 활용했다.
- 지역 공동체와의 데이터 협력에서 WAXAL은 사하라 이남 아프리카의 27개 언어를 다루고, Project Vaani는 109개 언어의 음성 3만 시간 이상을 수집했다. Amplify Initiative는 현지 전문가 1,600명 이상과 20개 대학의 참여로 다중모달 데이터 1만 5,000개를 확보했다.
- 안정적인 인터넷을 이용하기 어려운 30억 명 이상을 위해 Google은 55개 언어로 학습한 기기 내 실행 모델군 TranslateGemma를 개발했다. 피처폰용 음성 AI 서비스 Ask Viamo Anything은 르완다 시범 운영을 거쳤으며 Gemini로 200만 건 이상의 질문에 답했다.
- 50개 이상의 수어로 학습한 Sign Language-to-Text는 Pixel 11의 Gboard와 Live Transcribe에서 미국 수어를 영어로 변환하는 기능부터 제공한다. Google은 Māori 언어 전문가와 Google Maps의 지명 발음도 개선했으며, 언어 기술이 9개 플랫폼에서 50억 명 이상을 연결한다고 밝혔다.
🧩 주요 포인트
- 음성 직접 처리와 언어 간 전이 학습 → 감정·말투·언어 혼용을 보존하면서 학습 데이터가 적은 언어로 지원을 넓히려는 접근이다.
- WAXAL·Project Vaani·Amplify Initiative의 지역 협력 → 주요 언어에 편중된 웹 데이터를 보완하고 실제 발화와 문화적 맥락을 AI에 반영하는 기반이다.
- TranslateGemma·Ask Viamo Anything·Sign Language-to-Text와 현지 발음 개선 → 다언어 AI의 실효성은 지원 언어 수뿐 아니라 연결성·기기·접근성 제약과 문화적 정확성에 달려 있다.
🧠 상세 정리
1. 언어 지원의 확대와 남아 있는 격차
James Manyika는 2026년 9월 15일 글에서 Google의 기술과 제품이 현재 300개 이상의 언어로 일상적인 상호작용을 지원한다고 설명한다. 이 언어들의 사용자는 70억 명 이상으로 세계 인구의 86%에 해당하지만, 이는 모든 사람이 해당 제품을 이용한다는 의미는 아니다. Google은 이 성과에도 불구하고 기술이 오랫동안 소수의 지배적인 언어에 유리하게 작동했으며, 수천 개의 살아 있는 언어와 방언은 디지털 세계에서 제대로 표현되지 못했다고 지적한다. 2006년 언어 장벽 해소를 목표로 출시한 Google Translate는 소수 언어에서 출발해 현재 250개 이상의 언어를 지원한다. 그러나 글은 텍스트 번역만으로는 충분하지 않으며, 사람들이 실제로 소통하는 방식과 문화적 뉘앙스를 이해해야 한다는 방향으로 논의를 확장한다.
2. 텍스트 중심 처리에서 음성 자체의 이해로
기존 음성 인식 시스템은 음성을 텍스트로 옮기고, 그 텍스트를 처리한 다음 다시 음성으로 합성하는 여러 단계의 절차를 따랐다. Google은 이 방식이 기능적으로 작동하더라도 말투, 속도, 감정, 맥락처럼 인간 소통의 중요한 요소를 잃게 한다고 설명한다. 실제 대화에는 웃음, 겹쳐 말하기, 망설임이 있으며, Spanglish나 Hinglish처럼 문장 중간에 여러 언어를 섞는 현상도 나타난다. 이를 포착하기 위해 Gemini 같은 모델이 음성을 직접 처리하면서 소리와 의도를 함께 이해하도록 학습하고 있다. Gemini 3.5 Live Translate는 70개 언어와 2,000개 이상의 언어 쌍에서 실시간 통역을 지원하며 언어 전환과 감정 단서를 포착한다고 소개된다. Gemini 3.5 Transcribe는 소음과 전문용어가 있는 음성을 정돈된 텍스트로 바꾸며, Android Gboard의 Rambler에서 군더더기 제거, 문법·구두점 수정, 음성 명령 편집과 언어 전환을 지원한다.
3. 1,000개 언어를 향한 학습과 연구 기반
Google이 제시한 목표는 현재 AI가 잘 처리하는 언어를 넘어 세계에서 가장 많이 쓰이는 1,000개 언어를 지원하는 것이다. 이는 이미 달성한 지원 범위가 아니라 더 많은 사람이 선호하는 언어로 기술을 이용하도록 하기 위한 확장 목표다. 이를 뒷받침하는 Universal Speech Model은 1,200만 시간의 음성으로 학습했으며, 언어 간 전이 학습을 사용했다. 이 기법은 데이터가 풍부한 언어에서 배운 패턴을 학습 데이터가 훨씬 적은 언어에 적용해 음성 이해를 개선하는 방식으로 설명된다. 따라서 각 언어의 데이터 양에만 의존하지 않고 언어 사이에서 학습 성과를 옮기는 것이 지원 확대의 핵심 수단으로 제시된다. Google은 이러한 작업이 25년간의 공개 연구와 동료 심사를 거친 400편 이상의 음성 관련 논문을 기반으로 한다고 밝힌다.
4. 지역 공동체가 만드는 언어 데이터
웹이 소수의 주요 언어를 불균형하게 대표하기 때문에, Google은 소외된 언어를 이해하는 AI를 만들려면 데이터 수집 방식부터 바꿔야 한다고 설명한다. 그 대안인 지역 기반 협력 가운데 WAXAL은 Makerere University와 Digital Umuganda 등의 참여로 구축한 대규모 공개 음성 데이터셋이다. WAXAL은 26개가 넘는 국가에서 1억 명 이상이 사용하는 사하라 이남 아프리카의 27개 언어를 다루며, 기존 데이터에서 빠지기 쉬운 성조 변화와 대화 리듬을 담는다. Indian Institute of Science와 Bhashini가 참여한 Project Vaani는 언어 구분보다 지역을 중심으로 인도의 언어 다양성을 수집해, 현재까지 15만 5,000명 이상의 화자로부터 109개 언어의 음성 3만 시간 이상을 확보했다. Amplify Initiative에는 브라질 UFMG, 인도 IIT Kharagpur, 우간다 Makerere University 등을 포함한 4개 대륙의 20개 대학과 현지 전문가 1,600명 이상이 참여했다. 이 협력은 지역의 미묘한 차이를 담은 다중모달 데이터 1만 5,000개를 제공했다.
5. 공개 언어 자원에서 현장 활용으로
Google은 지역별 데이터 협력과 함께 공개 언어 혁신을 지원하는 새로운 도구 Language Explorer를 소개한다. 이 도구는 Google이 세계 최대의 오픈소스 언어 데이터 저장소라고 설명하는 LinguaMeta를 대화형으로 시각화한다. 음성 언어, 문자 언어, 수어를 포함한 7,000개 이상의 언어를 지속적으로 지도화하며, Fast Company로부터 디자인 혁신을 인정받았다고 밝혔다. 글은 이러한 데이터와 통찰이 지역에서 실질적인 변화를 만들 수 있는 사람들에게 전달될 때 혁신과 협력의 영향이 가장 커진다고 강조한다. Google.org가 지원하는 Centre for Digital Language Inclusion과 AI Singapore의 Project Aquarium은 농민, 의료 종사자, 교사 등에게 다언어 도구를 제공하는 활동의 사례로 제시된다. 이는 언어 자료를 구축하는 단계에서 실제 공동체 구성원의 활용으로 논의를 연결하는 부분이다.
6. 인터넷과 기기 성능의 제약을 줄이는 접근
Google은 30억 명 이상이 여전히 안정적인 인터넷을 이용하기 어렵다며, 연결이 제한되거나 끊기는 지역에서도 작동해야 기술에 실질적으로 접근할 수 있다고 설명한다. 이를 위해 개발한 TranslateGemma는 Gemini를 바탕으로 55개 언어에 걸쳐 학습한 경량 공개 번역 모델군이다. 기기에서 효율적으로 실행되므로 클라우드나 인터넷 연결 없이도 고품질 번역을 제공할 수 있다는 것이 Google의 설명이다. 다만 강력한 AI 모델을 실행하려면 충분한 하드웨어 성능이 필요해, 자원이 부족한 지역에서 피처폰을 쓰는 수억 명에게는 여전히 장벽이 남는다. Google은 이 격차를 줄이기 위해 일반 피처폰에서 Gemini를 활용하는 음성 AI 비서 Ask Viamo Anything을 운영하는 Viamo 같은 조직을 지원한다. Viamo는 르완다의 기존 자동응답 서비스 이용자를 대상으로 시범 운영을 성공적으로 진행했으며, 이 서비스는 Gemini로 이미 200만 건 이상의 질문에 답했다.
7. 수어 접근성과 지역 발음의 문화적 정확성
글은 언어를 지역별 어휘나 방언에 한정하지 않고 사람들이 소통하는 다양한 방식으로 넓혀 설명한다. 기존 음성 도구는 비전형적인 발화를 하는 사람들에게 자주 제대로 작동하지 않아, 기술 대신 사람이 적응해야 하는 문제를 낳는다고 지적한다. 접근성을 처음부터 고려한 사례인 Sign Language-to-Text는 50개 이상의 수어로 학습했으며, Pixel 11의 Gboard와 Live Transcribe에서 미국 수어를 영어로 옮기는 입력 기능부터 제공한다. Google은 이를 전 세계 수어 사용자 7,000만 명을 위한 접근성 개선의 첫 단계로 제시하므로, 학습한 모든 수어의 제품 지원을 뜻하는 것은 아니다. 이어 지명 발음을 잘못 읽는 내비게이션은 혼란을 일으킬 뿐 아니라 지역의 문화유산도 충분히 반영하지 못할 수 있다고 설명한다. 뉴질랜드에서는 Māori 언어 전문가들과 Google Maps의 지명 발음을 개선했으며, 문화적으로 올바른 발음을 음성 합성 모델에 직접 반영하는 접근을 강조한다.
8. 규모를 넘어 표현의 깊이와 다양성으로
Google은 20년이 넘는 AI 언어 연구·개발에서 얻은 핵심 교훈으로 기술이 인간 표현의 범위를 좁히지 않고 넓혀야 한다는 원칙을 제시한다. 현재 언어 기술은 Search, Android, Chrome, YouTube, Google Play 등을 포함한 9개 핵심 플랫폼에 통합돼 50억 명 이상을 연결한다고 설명한다. 이 수치는 앞서 언급한 지원 언어의 사용자 70억 명 이상과는 다른 범위의 설명으로, 제품 생태계에서의 연결 규모를 나타낸다. 그러나 글은 규모가 이야기의 일부일 뿐이며, 더 큰 목표는 맥락을 이해하고 문화를 존중하며 다양한 소통 방식을 수용하는 깊이와 풍부함에 있다고 강조한다. 앞으로도 지역 공동체와 긴밀히 협력해 더 많은 사람이 자신의 방식으로 소통하고 참여하며 이해받도록 돕겠다는 방향으로 마무리한다.
🧾 핵심 주장 / 시사점
- 원문은 다언어 AI의 발전을 지원 언어 수의 증가와 함께 음성의 감정·맥락·언어 혼용을 얼마나 보존하는지의 문제로 제시한다.
- 언어 간 전이 학습과 지역 공동체의 데이터 수집은 각각 학습 데이터 부족과 문화적 대표성 부족에 대응하는 상호 보완적 접근이다.
- 기기 내 실행만으로 모든 접근 장벽이 해소되지는 않는다. 원문은 피처폰 지원, 수어 입력, 현지 발음 개선을 통해 연결성·하드웨어·소통 방식별 대응이 필요함을 보여준다.
✅ 액션 아이템
- Gemini 3.5 Live Translate의 70개 언어·2,000개 이상 언어 쌍 지원과 1,000개 언어 지원 목표를 구분해 적용 범위 검토.
- WAXAL·Project Vaani·Amplify Initiative의 지역 협력을 중심으로 학습 데이터가 적은 언어와 문화적 맥락의 반영 방식 검토.
- 연결성·기기·접근성 제약에 따라 TranslateGemma·Ask Viamo Anything·Sign Language-to-Text의 활용 가능성 검토.
❓ 열린 질문
- 1,000개 언어 지원 목표에 도달하기 위해 학습 데이터가 적은 언어의 음성 이해를 어떻게 평가하고 개선할 것인가?
- WAXAL·Project Vaani·Amplify Initiative의 지역 협력이 실제 발화와 문화적 맥락의 반영을 얼마나 개선했는가?
- TranslateGemma·Ask Viamo Anything·Sign Language-to-Text가 대응한 뒤에도 남는 연결성·기기·접근성 제약은 무엇인가?