Gemma 3n fully available in the open-source ecosystem!
Quick Summary
젬마 3n은 적은 GPU 메모리로 구동되는 네이티브 멀티모달 모델로, 트랜스포머스·MLX·라마닷씨피피·트랜스포머스닷제이에스 등 주요 오픈소스 생태계에서 추론과 미세조정을 지원한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
젬마 3n은 적은 GPU 메모리로 구동되는 네이티브 멀티모달 모델로, 트랜스포머스·MLX·라마닷씨피피·트랜스포머스닷제이에스 등 주요 오픈소스 생태계에서 추론과 미세조정을 지원한다.
📌 핵심 요약
- 젬마 3n은 이미지·텍스트·오디오·비디오 입력을 지원하도록 처음부터 로컬 하드웨어 실행을 염두에 두고 설계됐으며, 구글 아이오에서의 미리보기 공개를 거쳐 주요 오픈소스 라이브러리에 정식 통합됐다.
- 출시 모델은 E2B와 E4B의 기본형·지시형으로 구성된다. 실제 매개변수 수는 각각 50억 개와 80억 개지만, 메모리 효율화 기술을 통해 GPU 메모리에서는 20억·40억 매개변수급 모델처럼 동작한다.
- 모바일넷 V5 기반 비전 인코더, 범용 음성 모델 기반 오디오 인코더, 중첩형 매트포머 구조, 계층별 임베딩, 키·값 캐시 공유를 결합해 멀티모달 처리와 로컬 실행 효율을 높였다.
- 트랜스포머스에서는 파이프라인이나 프로세서·모델 클래스를 사용해 텍스트, 음성, 이미지 및 이미지 프레임으로 표현한 비디오를 처리할 수 있으며, MLX와 라마닷씨피피, 올라마, 온닉스 런타임에서도 용도에 맞게 실행할 수 있다.
- 무료 구글 코랩 미세조정 노트북과 오디오 작업 전용 노트북, 젬마 레시피 저장소가 함께 제공돼 다양한 후속 작업과 데이터셋에 모델을 적용하고 사용법을 공동으로 확장할 수 있다.
🧩 주요 포인트
- 젬마 3n은 이미지·텍스트·오디오·비디오 입력을 지원하도록 처음부터 로컬 하드웨어 실행을 염두에 두고 설계됐으며, 구글 아이오에서의 미리보기 공개를 거쳐 주요 오픈소스 라이브러리에 정식 통합됐다.
- 출시 모델은 E2B와 E4B의 기본형·지시형으로 구성된다. 실제 매개변수 수는 각각 50억 개와 80억 개지만, 메모리 효율화 기술을 통해 GPU 메모리에서는 20억·40억 매개변수급 모델처럼 동작한다.
- 모바일넷 V5 기반 비전 인코더, 범용 음성 모델 기반 오디오 인코더, 중첩형 매트포머 구조, 계층별 임베딩, 키·값 캐시 공유를 결합해 멀티모달 처리와 로컬 실행 효율을 높였다.
- 트랜스포머스에서는 파이프라인이나 프로세서·모델 클래스를 사용해 텍스트, 음성, 이미지 및 이미지 프레임으로 표현한 비디오를 처리할 수 있으며, MLX와 라마닷씨피피, 올라마, 온닉스 런타임에서도 용도에 맞게 실행할 수 있다.
- 무료 구글 코랩 미세조정 노트북과 오디오 작업 전용 노트북, 젬마 레시피 저장소가 함께 제공돼 다양한 후속 작업과 데이터셋에 모델을 적용하고 사용법을 공동으로 확장할 수 있다.
🧠 상세 정리
1. 로컬 멀티모달 모델의 오픈소스 정식 공개
젬마 3n은 구글 아이오에서 미리보기로 발표된 뒤, 2025년 6월 26일 주요 오픈소스 생태계에서 정식으로 사용할 수 있게 됐다. 이 모델은 사용자의 로컬 하드웨어에서 실행하는 것을 처음부터 주요 목표로 삼았으며, 텍스트뿐 아니라 이미지·오디오·비디오 입력을 기본적으로 지원하는 멀티모달 모델이다. 공개와 동시에 트랜스포머스와 팀, MLX, 트랜스포머스닷제이에스, 올라마, 구글 에이아이 엣지 등에 통합됐고, 라마닷씨피피에서는 텍스트 입력을 처리할 수 있다. 글은 이러한 라이브러리에서 모델을 실제로 실행하는 방법과 다른 분야에 맞게 미세조정하는 방법을 코드 및 명령어 예제로 안내한다.
2. E2B·E4B 모델 구성과 유효 매개변수 개념
출시된 크기는 젬마 3n E2B와 E4B 두 가지이며, 각 크기마다 사전학습된 기본형과 명령 수행에 맞춘 지시형이 제공된다. 모델명의 E는 유효하다는 뜻으로, E2B와 E4B의 실제 매개변수 수는 각각 50억 개와 80억 개지만 GPU 메모리 요구량은 20억 개와 40억 개 모델에 가까움을 나타낸다. 이에 따라 하드웨어 지원 측면에서는 작은 모델처럼 다룰 수 있으면서도, 품질은 같은 메모리 등급의 일반적인 20억·40억 매개변수 모델보다 높은 것을 목표로 한다. 원문에 따르면 E2B는 최소 2기가바이트의 GPU 메모리에서 실행할 수 있고 E4B는 3기가바이트만으로도 실행할 수 있으며, 기본형과 지시형의 공식 모델 식별자가 각각 공개됐다.
3. 비전 및 오디오 인코더의 구성
젬마 3n은 언어 디코더 외에 별도의 비전 인코더와 오디오 인코더를 포함해 여러 입력 형식을 처리한다. 비전 부문에는 새로 공개된 모바일넷 V5 300 모델이 사용되며, 약 3억 개의 매개변수를 갖고 256×256, 512×512, 768×768 해상도를 지원한다. 원문은 이 비전 인코더가 구글 픽셀에서 초당 60프레임을 달성하고, 비전 트랜스포머 자이언트보다 매개변수를 세 배 적게 사용하면서 더 높은 성능을 보인다고 설명한다. 오디오 인코더는 범용 음성 모델을 기반으로 160밀리초 단위의 오디오를 처리하며, 음성을 텍스트로 변환하거나 영어 음성을 스페인어·프랑스어 등으로 번역하는 기능을 제공한다.
4. 매트포머와 메모리 효율화 구조
젬마 3n의 언어 모델 구조는 새 버전의 트랜스포머스에 추가됐으며, 이미지 인코딩은 팀에 구현된 모바일넷을 호출해 하나의 기준 구현을 공유한다. 핵심인 매트포머는 마트료시카 임베딩과 비슷한 중첩형 트랜스포머 설계로, 계층의 여러 부분집합을 각각 독립된 모델처럼 추출해 사용할 수 있도록 한다. E2B는 E4B의 하위 모델로 설정된 상태에서 함께 학습됐기 때문에, 사용자는 하드웨어 특성과 메모리 예산에 따라 계층 구성을 조합할 수 있다. 계층별 임베딩은 임베딩을 중앙처리장치로 넘겨 가속기 메모리 사용량을 줄이며, 이것이 실제 50억 매개변수인 E2B가 GPU에서는 약 20억 매개변수 모델 수준의 메모리를 쓰는 이유다. 여기에 키·값 캐시 공유를 적용해 오디오와 비디오의 긴 문맥을 처리할 때 젬마 3 4B보다 사전 채우기 단계를 두 배 빠르게 수행한다.
5. 성능 지표와 다국어 지원
성능 측면에서 E4B는 100억 개 미만 매개변수 모델 가운데 처음으로 엘엠아레나 점수 1300점을 넘긴 모델로 소개된다. 대규모 다중과제 언어이해 평가에서도 E4B와 E2B뿐 아니라 여러 혼합 구성 모델이 크기별로 경쟁력 있는 결과를 보였다고 원문은 설명한다. 언어 지원 범위는 텍스트에서 140개 언어, 멀티모달 상호작용에서 35개 언어에 이르며, 작은 메모리 요구량과 함께 폭넓은 활용 범위를 형성한다. 별도의 허깅페이스 스페이스도 제공되므로 사용자는 라이브러리를 직접 설치하기 전에 서로 다른 입력 형식과 프롬프트를 넣어 모델의 실제 반응을 확인할 수 있다.
6. 트랜스포머스를 이용한 멀티모달 추론
트랜스포머스에서 비전 입력을 사용하려면 모바일넷 비전 인코더를 제공하는 최신 팀과 최신 트랜스포머스를 설치해야 한다. 가장 간단한 방식은 이미지-텍스트-텍스트 파이프라인에 E4B 지시형 모델, 쿠다 장치, 비플로트16 자료형을 지정하고 이미지와 질문으로 구성된 메시지를 전달하는 것이다. 더 세밀한 방식에서는 오토프로세서와 이미지-텍스트-텍스트용 자동 모델을 불러온 뒤, 채팅 템플릿으로 입력을 변환하고 추론 모드에서 새 토큰을 생성하며 입력 구간을 제외한 결과만 디코딩한다. 같은 메시지 형식을 이용해 프랑스의 수도를 묻는 텍스트 질의, 영어 음성 전사, 이미지 설명을 수행할 수 있으며, 비디오는 여러 이미지 프레임의 묶음으로 전달한다. 원문 예제에서는 항공기 이미지를 설명하고, 음성 파일에서 내일 늦게 귀가한다는 내용의 메시지를 전사하는 결과를 보여준다.
7. MLX·라마닷씨피피·자바스크립트 실행 경로
MLX는 공개 첫날부터 젬마 3n의 텍스트·비전·오디오 입력을 지원하며, 최신 엠엘엑스 브이엘엠을 설치한 뒤 명령줄에서 모델과 프롬프트, 이미지 또는 오디오 주소를 지정해 실행할 수 있다. 비전 예제는 항공기 이미지를 자세히 설명하도록 요청하고, 오디오 예제는 음성 구간을 영어로 전사하도록 구성된다. 라마닷씨피피와 올라마에서는 소스 설치 후 젬마 3n을 사용할 수 있지만, 원문에서 라마닷씨피피 지원 범위는 텍스트 입력으로 명시돼 있으며 양자화된 E4B 지시형 모델을 서버로 실행하는 명령이 제시된다. 또한 E2B 지시형의 온닉스 가중치가 공개돼 여러 런타임과 플랫폼에 배포할 수 있고, 자바스크립트 개발자는 3.6.0 버전부터 트랜스포머스닷제이에스에 통합된 모델을 사용할 수 있다.
8. 무료 미세조정 환경과 공동 레시피
모델 크기가 비교적 작기 때문에 젬마 3n은 여러 입력 형식에 걸친 특정 후속 작업에 맞춰 미세조정하기 편리한 모델로 제시된다. 글은 무료 구글 코랩에서 실험할 수 있는 간단한 미세조정 노트북을 제공하며, 음성 데이터셋과 평가 항목에 맞게 모델을 조정하려는 사용자를 위한 오디오 작업 전용 노트북도 별도로 안내한다. 이번 공개와 함께 마련된 허깅페이스 젬마 레시피 저장소에는 모델 실행과 미세조정을 위한 노트북 및 스크립트가 수록돼 있다. 작성진은 사용자가 젬마 계열을 실제 작업에 적용한 뒤 새로운 레시피를 추가하고, 이슈와 풀 리퀘스트를 통해 저장소에 기여하기를 요청한다. 글은 젬마 3n의 작은 크기, 멀티모달 입력, 높은 성능을 이번 공개의 주요 가치로 정리하고 통합 작업에 참여한 구성원들에게 감사를 전한다.
🧾 핵심 주장 / 시사점
- 젬마 3n의 핵심은 실제 매개변수 수 자체를 줄인 것이 아니라, 계층별 임베딩의 중앙처리장치 이전과 중첩형 구조를 통해 GPU 메모리 부담을 낮추면서 더 큰 모델의 품질을 활용하도록 설계한 데 있다.
- 하나의 멀티모달 모델이라도 실행 환경별 지원 범위는 동일하지 않다. 트랜스포머스와 MLX는 여러 입력 형식을 다루지만, 원문이 소개한 라마닷씨피피 경로는 텍스트 입력으로 한정된다.
- 모델 공개와 동시에 기준 구현, 브라우저·자바스크립트용 통합, 온닉스 가중치, 무료 미세조정 노트북과 레시피 저장소까지 제공돼 추론부터 분야별 조정까지 이어지는 사용 경로가 마련됐다.
✅ 액션 아이템
- 트랜스포머스 파이프라인으로 텍스트·음성·이미지·영상 프레임 입력 경로를 열어 멀티모달 동작 여부를 동일 데이터셋에서 점검한다.
- E2B와 E4B의 기본형·지시형 모델을 실제 추론 환경에서 메모리 사용을 2B/4B급으로 확인하고 적용 시나리오를 분리한다.
- 모바일넷V5 비전 인코더, 범용 음성 인코더, 중첩형 매트포머와 kv 캐시 공유 결합 효과를 실측해 로컬 배포 최적화를 판단한다.
❓ 열린 질문
- 모바일넷V5 기반 비전 인코더와 범용 음성 인코더 조합이 각 모달리티에서 품질-메모리 트레이드오프를 어떻게 바꾸는가?
- MLX, 라마닷씨피피, 올라마, 온닉스 런타임 중 어떤 조합이 로컬 하드웨어에서 멀티모달 처리 지연을 가장 낮출 것인가?
- 무료 코랩 미세조정 노트북과 오디오 전용 노트북으로 각 데이터셋·과업별 미세조정 절차를 동일 기준으로 재현할 수 있는가?