Introducing Falcon-H1-Arabic: Pushing the Boundaries of Arabic Language AI with Hybrid Architecture
Quick Summary
팔콘 에이치원 아라빅은 맘바와 트랜스포머를 결합한 하이브리드 구조, 최대 25만 6천 토큰의 문맥 창, 아랍어 특화 데이터와 후속 학습을 통해 규모별 최고 수준의 아랍어 처리 성능을 목표로 한 3종 모델군이다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
팔콘 에이치원 아라빅은 맘바와 트랜스포머를 결합한 하이브리드 구조, 최대 25만 6천 토큰의 문맥 창, 아랍어 특화 데이터와 후속 학습을 통해 규모별 최고 수준의 아랍어 처리 성능을 목표로 한 3종 모델군이다.
📌 핵심 요약
- 기존 팔콘 아라빅 사용자들의 피드백을 바탕으로 장문 이해, 방언 처리, 수학적 추론, 전문 영역 지식의 한계를 개선하기 위해 30억·70억·340억 매개변수 모델을 개발했다.
- 각 블록에서 상태 공간 모델인 맘바와 트랜스포머 어텐션을 병렬로 실행하고 표현을 결합해, 긴 입력에 대한 효율성과 정밀한 장거리 관계 모델링을 함께 추구했다.
- 30억 모델은 12만 8천 토큰, 70억과 340억 모델은 25만 6천 토큰을 처리하며, 장문 입력을 실제로 활용하도록 지도 미세 조정과 직접 선호 최적화를 수행했다.
- 약 3천억 토큰 규모의 학습 자료에는 아랍어·영어·다국어 콘텐츠가 거의 균등하게 포함됐으며, 현대 표준 아랍어뿐 아니라 이집트·레반트·걸프·마그레브 방언도 확대했다.
- 공개된 평가 결과에서 세 모델은 유사하거나 더 큰 모델과 경쟁하는 성능을 보였지만, 제작진은 환각과 편향, 극단적으로 긴 문맥에서의 성능 저하 가능성을 명시했다.
🧩 주요 포인트
- 기존 팔콘 아라빅 사용자들의 피드백을 바탕으로 장문 이해, 방언 처리, 수학적 추론, 전문 영역 지식의 한계를 개선하기 위해 30억·70억·340억 매개변수 모델을 개발했다.
- 각 블록에서 상태 공간 모델인 맘바와 트랜스포머 어텐션을 병렬로 실행하고 표현을 결합해, 긴 입력에 대한 효율성과 정밀한 장거리 관계 모델링을 함께 추구했다.
- 30억 모델은 12만 8천 토큰, 70억과 340억 모델은 25만 6천 토큰을 처리하며, 장문 입력을 실제로 활용하도록 지도 미세 조정과 직접 선호 최적화를 수행했다.
- 약 3천억 토큰 규모의 학습 자료에는 아랍어·영어·다국어 콘텐츠가 거의 균등하게 포함됐으며, 현대 표준 아랍어뿐 아니라 이집트·레반트·걸프·마그레브 방언도 확대했다.
- 공개된 평가 결과에서 세 모델은 유사하거나 더 큰 모델과 경쟁하는 성능을 보였지만, 제작진은 환각과 편향, 극단적으로 긴 문맥에서의 성능 저하 가능성을 명시했다.
🧠 상세 정리
1. 기존 모델의 피드백에서 출발한 재설계
팔콘 에이치원 아라빅은 몇 달 앞서 공개된 팔콘 아라빅의 단순한 확장판이 아니라, 실제 사용자 피드백을 반영해 접근법을 다시 설계한 모델군이다. 아랍권의 개발자·연구자·학생들이 기존 모델을 다양한 실제 사례에 적용하면서 장문 문맥 이해, 지역별 방언 차이, 수학적 추론, 전문 영역 지식이 주요 개선 과제로 드러났다. 개발진은 이러한 문제를 점진적인 성능 조정만으로 해결하지 않고, 아랍어 언어 모델에서 이전에 충분히 탐색되지 않았던 구조적 혁신과 데이터 학습 방식의 개선을 함께 추진했다고 설명한다. 그 결과 30억·70억·340억 매개변수의 세 모델이 구성됐으며, 각각 제한된 자원의 경량 환경부터 일반적인 운영 환경과 고정확도 업무까지 서로 다른 배포 조건을 겨냥한다.
2. 맘바와 어텐션을 결합한 하이브리드 구조
모델의 핵심은 팔콘 에이치원에서 도입된 하이브리드 구조로, 모든 블록 안에서 상태 공간 모델인 맘바와 트랜스포머 어텐션을 병렬로 실행한다는 점이다. 두 구성 요소가 만든 표현은 블록의 출력 투영 전에 결합되며, 상태 공간 모델의 선형 시간 확장성과 어텐션의 정밀한 장거리 관계 모델링을 동시에 활용하도록 설계됐다. 개발진은 복잡한 형태론과 유연한 문장 구조를 지닌 아랍어에서 이 조합이 긴 글 전체의 일관성과 추론 능력을 높이는 데 특히 유용하다고 설명한다. 모델 크기에 따라 상태 공간 모델과 어텐션의 헤드 수는 달라지지만 기본적인 병렬 처리와 표현 결합 방식은 세 모델에 공통으로 적용되며, 용량·효율·배포 가능성 사이의 균형은 규모별로 조정된다.
3. 최대 25만 6천 토큰으로 확장된 문맥 처리
기존 팔콘 아라빅의 문맥 한도는 3만 2천 토큰이었지만, 새 모델군에서는 30억 모델이 12만 8천 토큰, 70억과 340억 모델이 각각 25만 6천 토큰을 지원한다. 25만 6천 토큰은 약 20만 단어에 해당해 여러 권의 소설이나 수백 쪽의 기술 문서를 한 번에 입력할 수 있는 규모로 제시됐다. 이에 따라 법률 자료 분석, 의료 기록 정리, 학술 연구, 장시간 대화처럼 기존에는 처리하기 어려웠던 작업을 주요 활용 대상으로 삼았다. 다만 개발진은 긴 입력을 단순히 받아들이는 것과 그 내용을 효과적으로 사용하는 것은 다르다고 보고, 문맥 중간의 정보를 놓치는 현상을 줄이는 후속 학습을 별도로 진행했다. 규모별로는 30억 모델이 빠른 에이전트와 고처리량 시스템, 70억 모델이 운영용 비서와 기업 대화 시스템, 340억 모델이 장문 분석과 중요도가 높은 업무에 맞춰졌다.
4. 아랍어 품질과 방언 다양성을 반영한 학습 자료
사전 학습 자료 처리 과정은 아랍어의 복잡성을 더 정확히 반영하기 위해 처음부터 다시 구축됐다. 개발진은 단순한 경험적 규칙에 의존하는 대신 아랍어의 표기법, 형태론, 발음 구별 기호, 통사 구조를 고려한 여러 단계의 언어학적 품질 필터링을 적용해, 공개 웹 자료에서 흔히 발견되는 잡음을 제거하고 일관성 있는 문장을 선별했다고 설명한다. 또한 아랍어를 하나의 단일한 형태로 취급하지 않고 현대 표준 아랍어와 함께 이집트·레반트·걸프·마그레브 방언 자료를 크게 확대해 실제 언어 사용 범위를 반영했다. 코드, 과학·기술·공학·수학, 언어 간 추론 능력도 유지하기 위해 전체 약 3천억 토큰을 아랍어·영어·다국어 콘텐츠가 거의 균등하게 섞이도록 구성했다. 따라서 학습 목표는 형식적인 표준 아랍어 성능에만 집중하는 것이 아니라 방언 이해와 전문 분야의 일반 추론 능력을 함께 보존하는 데 놓였다.
5. 장문 활용 능력을 다듬은 후속 학습
사전 학습 이후에는 지도 미세 조정과 직접 선호 최적화가 순서대로 적용됐다. 지도 미세 조정 단계에서는 고품질 아랍어 지시문, 엄선된 장문 문맥 사례, 구조화된 추론 과제를 사용해 지시 준수, 긴 출력의 일관성, 관련 정보에 근거한 답변 방식을 학습시켰다. 이는 큰 문맥 창이 구조만으로 자동으로 유용해지는 것이 아니므로, 모델이 실제로 앞뒤 정보를 연결하고 활용하게 만드는 핵심 단계로 설명된다. 이어진 직접 선호 최적화에서는 대화 품질과 선호 일관성을 개선하는 한편, 대화가 주제에서 벗어나거나 입력 문맥을 지나치게 사용하거나 앞부분의 정보를 무시하는 실패 양상을 줄이는 데 초점을 맞췄다. 두 단계 모두 장문 능력 향상이 기본 추론과 사실 정확성을 훼손하지 않도록 파국적 망각을 관찰하며 통제된 학습 순서를 사용했고, 평가 점수만으로 충분히 드러나지 않는 대화 충실도·수사적 구성·후속 응답 구조·담화 일관성도 강화했다.
6. 30억 모델의 효율성과 평가 성과
아랍어 이해 과제를 종합한 공개 아랍어 대규모 언어 모델 순위표에서 30억 모델은 약 62퍼센트를 기록해 젬마 40억, 큐원3 40억, 파이4 미니 등 비교 대상 소형 모델보다 약 10퍼센트포인트 높은 결과를 보였다고 제시됐다. 과학·기술·공학·수학 중심의 3엘엠 평가에서는 원어 자료 분할에서 약 82퍼센트, 합성 자료 분할에서 약 73퍼센트를 기록했다. 아랍 문화 평가에서는 약 62퍼센트, 이집트·걸프·레반트 방언을 다룬 아라다이스 평가에서는 약 50퍼센트의 결과가 보고됐다. 개발진은 이 모델이 비교적 작은 규모에서도 높은 아랍어 성능을 제공하므로 지연 시간과 비용이 중요한 기기 내 실행, 실시간 서비스, 에이전트형 시스템, 고처리량 환경에 적합하다고 설명한다. 다만 공개 순위표와 달리 빠른 실행을 위해 브이엘엘엠 기반 평가를 사용했으므로 점수가 순위표 수치와 1점 미만 범위에서 다를 수 있다고 덧붙였다.
7. 70억과 340억 모델의 성능 및 역할
70억 모델은 공개 아랍어 순위표에서 71.7퍼센트를 기록해 파나르 90억, 알람 70억, 큐원3 80억 등 약 100억 규모의 비교 모델을 앞섰다고 보고됐다. 3엘엠에서는 원어 자료 약 92퍼센트와 합성 자료 약 85퍼센트, 아랍 문화 평가에서는 약 80퍼센트, 방언 평가에서는 50퍼센트대 중반을 기록해 성능과 배포 가능성의 균형을 갖춘 일반 운영용 모델로 제시됐다. 대표 모델인 340억 모델은 공개 아랍어 순위표에서 약 75퍼센트를 기록했으며, 같은 규모뿐 아니라 라마 3.3 700억과 에이스지피티2 320억 같은 비교 대상보다 높은 결과를 냈다고 설명한다. 이 모델의 3엘엠 점수는 원어 자료 약 96퍼센트와 합성 자료 약 94퍼센트였고, 아랍 문화 평가에서는 약 80퍼센트, 방언 평가에서는 약 53점을 기록했다. 개발진은 이러한 결과를 하이브리드 구조, 학습 자료의 품질, 후속 학습 과정이 결합된 성과로 해석하지만, 각 점수는 특정 평가 체계에서 측정된 결과로 제시된다.
8. 배포 시나리오와 명시된 한계
세 모델은 동일한 계열에 속하지만 실제 배포 목적은 뚜렷하게 구분된다. 30억 모델은 속도·비용 효율·높은 처리량을 우선해 에이전트 흐름, 기기 내 응용, 저지연 대화, 자원이 제한된 환경에 맞고, 70억 모델은 문서 이해·대화형 서비스·요약·콘텐츠 생성 등 대부분의 범용 운영 작업을 담당하는 선택지로 제시됐다. 340억 모델은 정확성과 장거리 추론이 특히 중요한 법률 분석, 의료 요약, 학술 연구, 대규모 기업 자동화를 대상으로 하며, 수백 쪽의 문서를 한 번에 분석하면서 일관성을 유지하는 능력을 강조한다. 그러나 개발진은 모든 언어 모델과 마찬가지로 학습 자료의 편향을 반영하거나 사실과 다른 내용을 생성할 수 있고, 문맥이 극단적인 길이에 이르면 성능이 저하될 가능성이 있다고 명시했다. 따라서 의료·법률·금융 판단에서 모델 출력을 유일한 근거로 사용하지 말고 전문가의 확인을 거쳐야 하며, 운영 또는 민감한 환경에 배치하기 전에는 작업별 평가와 적절한 안전장치를 적용해야 한다.
🧾 핵심 주장 / 시사점
- 이 모델군의 장문 처리 능력은 문맥 창의 수치적 확대만으로 구성되지 않으며, 문맥 중간 정보의 누락을 줄이는 지도 미세 조정과 직접 선호 최적화가 함께 적용됐다.
- 아랍어 특화 성능은 표준 아랍어 자료만 늘린 결과가 아니라 언어학적 품질 필터링, 여러 지역 방언의 확대, 아랍어·영어·다국어 자료의 균형을 함께 추구한 학습 설계에 기반한다.
- 세 모델은 하나의 모델을 단순히 크기별로 제공하는 데 그치지 않고, 30억은 효율 중심, 70억은 범용 운영 중심, 340억은 장문·고중요도 업무 중심으로 배포 목적과 문맥 용량을 구분했다.
✅ 액션 아이템
- 30억·70억·340억 모델 각각의 토큰 창(12만8천·25만6천)에서 장문 입력 처리 성능을 동일 조건으로 점검한다.
- 맘바와 트랜스포머 병렬 결합 구조가 긴 입력 효율성과 장거리 관계 정밀도에 미치는 영향을 모델별로 비교한다.
- 3천억 토큰 학습 데이터의 언어 비중(아랍어·영어·다국어)과 방언 구성(이집트·레반트·걸프·마그레브)을 정량화해 성능 분포와의 연계를 분석한다.
❓ 열린 질문
- 공개 평가에서 제시된 세 모델의 성능이 과업군별로 경쟁 모델 대비 장기간 일관되게 우위가 유지되는가?
- 극단적으로 긴 문맥에서 성능 저하가 나타나는 토큰 임계점은 25만6천 근처 어느 구간에서 가장 먼저 드러나는가?
- 환각과 편향은 어떤 질의 유형에서 자주 발생하며 사용자 피드백만으로 조기에 탐지 가능한가?