Articlehuggingface.co·2026년 9월 3일·0

NeoMME: an efficient Multimodal-native and Multilingual Encoder

Quick Summary

NeoMME는 단일 양방향 Transformer로 이미지와 다국어 텍스트를 처리하는 260M·800M 인코더로, 시각 문서 검색에서 모델 크기 대비 검색 품질과 인코딩·저장 효율을 확보했다.

NeoMME: an efficient Multimodal-native and Multilingual Encoder 관련 대표 이미지

🖼️ 인포그래픽

NeoMME: an efficient Multimodal-native and Multilingual Encoder 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

NeoMME: an efficient Multimodal-native and Multilingual Encoder의 핵심 내용을 4단계로 요약한 인포그래픽
NeoMME: an efficient Multimodal-native and Multilingual Encoder 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

NeoMME는 단일 양방향 Transformer로 이미지와 다국어 텍스트를 처리하는 260M·800M 인코더로, 시각 문서 검색에서 모델 크기 대비 검색 품질과 인코딩·저장 효율을 확보했다.

📌 핵심 요약

  • NeoMME는 별도의 사전학습 비전 타워나 인과적 언어 모델 없이 처음부터 학습한 멀티모달 인코더이며, 260M·800M 두 모델 모두 16,384토큰 문맥을 지원한다.
  • 이미지를 보면서 마스킹된 텍스트를 복원하는 이산 마스킹 확산 방식으로 학습했으며, 각 모델은 텍스트 전용 약 2,900억 토큰을 포함해 총 약 5,240억 입력 토큰을 처리했다.
  • NeoMME-Retriever는 문서 페이지를 이미지로 검색하며, 한 번의 순전파로 밀집 임베딩과 후기 상호작용 임베딩을 함께 생성한다.
  • ViDoRe v3의 nDCG@10은 260M 모델이 0.523, 800M 모델이 0.556으로, 두 모델 모두 검색 품질과 모델 크기의 파레토 전선에 위치한다.
  • NVIDIA L40S에서 2048×2048 입력을 사용한 260M 모델의 인코딩 속도는 초당 약 51페이지였으며, 후기 상호작용 인덱스는 압축으로 페이지당 약 1.5 MB에서 6 kB로 줄이면서 기준 nDCG@10의 95% 이상을 유지했다.

🧩 주요 포인트

  1. 이미지와 텍스트가 같은 Transformer 경로를 공유하므로, 두 모달리티의 사전학습·미세조정·병렬화·서빙을 공통 구조로 처리할 수 있다.
  2. 밀집 임베딩과 후기 상호작용 임베딩의 동시 생성으로, 대규모 문서 집합에서 근사 최근접 이웃 검색 후 후보를 재순위화하는 구성이 가능하다.
  3. ViDoRe v3의 검색 품질과 인코딩 속도, 인덱스 압축 결과는 모델 크기·문서 처리량·저장 공간을 함께 고려하는 검색 시스템의 선택 근거를 제공한다.

🧠 상세 정리

1. 생성형 모델의 부담을 줄인 멀티모달 인코더

NeoMME는 텍스트와 이미지의 벡터 표현을 생성하는 다국어·멀티모달 기반 인코더로, 260M과 800M 두 크기로 제공된다. 기존의 많은 시각 문서 검색기는 별도로 사전학습한 비전 인코더의 출력을 프로젝터로 변환한 뒤 인과적 언어 디코더에 전달하는 생성형 시각 언어 모델 구조를 활용한다. 원문은 검색·분류·토큰 라벨링이 텍스트를 자기회귀적으로 생성하지 않으므로, 이러한 디코더와 그에 따른 매개변수·연산 부담이 필수적이지 않다고 설명한다. ModernVBERT가 양방향 텍스트 인코더를 도입하면서도 SigLIP2 비전 타워를 유지한 것과 달리, NeoMME는 기존 비전 타워나 텍스트 인코더·디코더에 의존하지 않고 처음부터 학습된다. 이미지와 텍스트가 동일한 계산 경로를 사용하므로 두 모달리티에 걸친 학습, 병렬화, 서빙을 더 쉽게 지원할 수 있다는 것이 설계 취지다.

2. 단일 Transformer의 입력과 문맥 설계

두 NeoMME 모델은 같은 아키텍처를 사용하며, 텍스트에는 분해형 토큰 임베딩을 적용하고 이미지는 겹치지 않는 32×32 패치로 나누어 작은 다층 퍼셉트론으로 투영한다. 이렇게 만든 텍스트 토큰과 이미지 패치는 하나의 양방향 Transformer 인코더에 함께 입력된다. 동적 이미지 해상도를 지원해 이미지의 종횡비와 크기를 유지하며, 정보가 많은 고해상도 문서에는 더 많은 토큰을 사용할 수 있다. 문맥 길이는 16,384토큰으로 표준 3840×2160 해상도의 4K UHD 이미지 두 장까지 수용하며, 대부분의 층은 대칭 슬라이딩 윈도 주의를, 매 여섯 번째 층과 마지막 층은 전역 주의를 사용한다. 인코더에는 그룹 쿼리 주의, 쿼리·키 정규화, 게이트 주의, 2차원 회전 위치 임베딩, 제곱 ReLU 다층 퍼셉트론 등의 개선 기법도 적용됐다.

3. 이미지 근거를 학습시키는 텍스트 복원

NeoMME는 이산 마스킹 확산 방식으로 손상된 텍스트를 복원하도록 처음부터 사전학습한다. 텍스트 전용 예제에서는 0부터 1 사이의 손상률을 균등하게 뽑고 각 대상 토큰을 해당 확률로 독립적으로 마스킹하지만, 멀티모달 예제에서는 이미지 패치를 그대로 보여 주면서 텍스트 손상률을 0.3부터 1 사이로 설정한다. 마스킹이 적으면 주변 단어만으로 빈칸을 복원할 수 있으므로, 높은 손상률을 통해 언어 문맥에만 의존하는 지름길을 줄이고 이미지의 시각적 근거를 활용하도록 유도한다. 학습에는 다국어 텍스트, 코드, 수학, 자연 이미지, 문서 이미지가 섞여 있으며, 별도로 학습한 BPE 토크나이저는 약 13만 1천 개의 어휘를 사용한다. 각 모델은 패킹된 입력 약 5,240억 토큰을 처리했고 그중 텍스트 전용 입력은 약 2,900억 토큰으로, ModernBERT의 2조 학습 토큰보다 적은 텍스트 예산에서 데이터 효율을 높이기 위해 NorMuon 최적화기를 선택했다.

4. 페이지 이미지 검색과 두 종류의 검색 헤드

NeoMME-Retriever는 기반 인코더를 시각 문서 검색에 미세조정한 모델로, ColPali가 도입한 페이지 이미지 방식을 사용한다. 텍스트 조각을 추출해 검색하는 대신 문서 페이지의 스크린샷을 직접 순위화하므로, PDF에서 텍스트를 추출하기 위한 OCR 전처리를 우회하면서 배치, 차트, 표, 글꼴 종류와 크기 같은 시각 정보를 보존한다. 밀집 검색 헤드는 인코더의 은닉 상태를 평균 풀링한 뒤 정규화한 하나의 벡터를 만들며, 작은 표현 크기와 근사 최근접 이웃 검색의 활용에 적합하다. 후기 상호작용 헤드는 각 텍스트 토큰이나 이미지 패치의 은닉 상태를 정규화된 128차원 벡터로 투영해, 개별 질의 토큰과 이미지 영역 사이의 세밀한 대응을 유지한다. 두 헤드는 함께 학습되며 한 번의 순전파에서 두 표현을 모두 반환하므로, 일반적으로 후기 상호작용을 사용하거나 대규모 문서 집합에서 밀집 검색으로 후보를 찾은 뒤 후기 상호작용으로 재순위화할 수 있다.

5. 모델 크기 대비 검색 품질

ViDoRe v3에서 NeoMME-Retriever-260M은 nDCG@10 0.523을 기록해, 평가 대상 중 매개변수가 800M 미만인 모델 가운데 가장 높은 점수를 보였다. 원문은 이 모델이 ColQwen2.5보다 약 14배 적은 매개변수를 사용하면서 nDCG@10 차이가 0.002 이내라고 설명하며, 표에 제시된 두 점수는 각각 0.523과 0.524다. NeoMME-Retriever-800M의 점수는 0.556으로 Vultron Flash의 0.565보다 0.009 낮았고, 두 NeoMME 모델 모두 모델 크기와 검색 품질의 파레토 전선에 위치했다. nDCG@5를 사용하는 ViDoRe v1·v2에서는 260M 모델이 ColModernVBERT와 ColSmol-500M을 앞섰고, 800M 모델은 ColPali v1.3보다 매개변수가 3.6배 적으면서 더 높은 점수를 기록했다. 비교 표에는 MTEB에서 가져온 점수와 저자들이 직접 평가한 결과가 함께 포함되어 있으며, v3와 v1·v2는 평가 지표의 순위 범위가 다르다.

6. 고해상도 후기 상호작용 인덱스의 압축

후기 상호작용 임베딩의 저장량은 출력 벡터 수에 비례하므로, 패치가 많은 고해상도 이미지일수록 인덱스가 커진다. NeoMME-Retriever에서 2048×2048 페이지는 4,200개 벡터를 생성해 float32 기준 약 2.1 MB가 필요하며, ViDoRe v3 전체의 실제 평균은 문서당 약 1.5 MB였다. 이를 줄이기 위해 유사한 문서 벡터를 묶어 평균으로 대체하는 계층적 토큰 풀링과, 문서 임베딩을 int8 또는 이진 표현으로 바꾸는 비대칭 양자화를 결합했다. 풀링 계수 10에 질의와 문서 모두 int8을 사용하면 페이지당 39 kB로 약 39배 압축하면서 기준 nDCG@10의 99% 이상을 유지했다. 풀링 계수 8에 int8 질의와 이진 문서를 사용한 더 강한 압축에서는 페이지당 6 kB로 약 255배 줄이면서 기준 품질의 95% 이상을 유지해, 저장 예산과 필요한 검색 품질에 따라 설정을 선택할 수 있음을 보였다.

7. 문서 인코딩 처리량과 측정 조건

검색에 앞서 문서를 임베딩으로 변환해 벡터 저장소에 넣어야 하므로, 인코딩 속도는 초기 인덱스 구축과 새 문서 추가에 필요한 시간에 영향을 준다. 원문은 인코딩이 빨라지면 이 과정의 GPU 가동 시간과 연산 비용을 줄일 수 있다는 점에서 여러 멀티모달 문서 검색기의 처리량을 비교했다. 측정에는 전처리된 이미지 텐서를 사용했고, 모델과 이미지 크기마다 배치 크기를 별도로 조정했다. 단일 NVIDIA L40S에서 입력 해상도를 2048×2048로 맞췄을 때 NeoMME-Retriever-260M은 초당 약 51페이지를 인코딩해 ColModernVBERT의 초당 26페이지보다 거의 두 배 빨랐다. 더 작은 입력 이미지에서도 260M과 800M 모델 모두 비교 대상 모델보다 빨랐으며, 제시된 수치는 이처럼 명시된 하드웨어와 전처리·배치 조건에서 측정한 이미지 인코딩 처리량이다.

8. 공개 범위와 제공된 활용 안내

NeoMME는 Hugging Face Transformers에서 사용할 수 있으며, 모든 모델 체크포인트는 Apache 2.0 라이선스로 공개됐다. 검색 모델의 260M과 800M 버전은 모두 밀집 임베딩과 토큰·패치 단위의 다중 벡터 임베딩을 함께 반환하므로, 같은 모델 출력으로 서로 다른 검색 구성을 지원한다. 원문은 후기 상호작용 임베딩을 일반적인 권장 선택으로 제시하고, 이를 활용할 수 있는 공개 라이브러리로 NextPlaid를 언급한다. 제공된 본문 끝부분은 두 텍스트 질의와 두 문서 페이지 이미지 사이의 점수를 MeanMaxSim 후기 상호작용으로 계산하는 예제를 소개하지만, 문장이 중간에서 끊겨 실제 예제 코드는 포함되지 않는다. 목차에는 Sentence Transformers를 이용한 미세조정과 시각 RAG 활용도 나열되어 있으나 해당 설명 본문은 제공되지 않아, 이 자료에서 확인되는 활용 정보는 공개 방식과 검색 표현·구성 안내까지다.

🧾 핵심 주장 / 시사점

  • NeoMME의 효율성은 작은 모델 크기뿐 아니라 이미지와 텍스트의 계산 경로 통합, 문서 인코딩 처리량, 후기 상호작용 인덱스 압축에서 함께 나타난다.
  • 두 검색 표현을 한 번에 생성하는 설계는 밀집 검색의 후보 추출과 후기 상호작용의 세밀한 재순위화를 연결할 수 있게 한다.
  • 압축 결과는 저장 공간과 검색 품질 사이의 선택지를 보여 주지만, 제시된 품질 유지율은 ViDoRe v3에서 평가한 설정에 대한 결과다.

✅ 액션 아이템

  • NeoMME 260M·800M의 모델 크기와 ViDoRe v3 검색 품질을 비교해 적용 후보 검토.
  • 대규모 문서 집합에서 밀집 임베딩 검색 후 후기 상호작용 임베딩으로 재순위화하는 구성 검토.
  • 페이지당 6 kB 압축과 기준 nDCG@10의 95% 이상 유지 결과를 바탕으로 저장 공간과 검색 품질의 절충 검토.

❓ 열린 질문

  • NeoMME 260M·800M 중 모델 크기와 ViDoRe v3 검색 품질을 고려할 때 어느 쪽이 적용 목적에 더 적합한가?
  • 대규모 문서 집합에서 밀집 임베딩 검색과 후기 상호작용 재순위화를 결합할 필요가 있는가?
  • 페이지당 6 kB와 기준 nDCG@10의 95% 이상 유지라는 압축 결과가 요구하는 저장 공간과 검색 품질을 충족하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.