Articlehuggingface.co·2026년 7월 16일·0

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval

Quick Summary

NVIDIA Nemotron 3 Embed는 RTEB 전체 1위의 8B 모델과 효율 중심의 1B 변형을 함께 제공해 검색 정확도, 에이전트 토큰 비용, 배포 성능의 균형을 겨냥한 임베딩 모델 제품군이다.

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval 관련 대표 이미지

🖼️ 인포그래픽

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

NVIDIA Nemotron 3 Embed Ranks #1 Overall on RTEB, Advancing Agentic Retrieval 내용을 설명하는 본문 이미지

💡 한 줄 요약

NVIDIA Nemotron 3 Embed는 RTEB 전체 1위의 8B 모델과 효율 중심의 1B 변형을 함께 제공해 검색 정확도, 에이전트 토큰 비용, 배포 성능의 균형을 겨냥한 임베딩 모델 제품군이다.

📌 핵심 요약

  • NVIDIA는 프로덕션 RAG, 에이전트형 검색, 코드 검색, 에이전트 메모리를 지원하기 위해 오픈 모델 3종으로 구성된 Nemotron 3 Embed 제품군을 공개했다.
  • Nemotron-3-Embed-8B-BF16은 RTEB에서 78.5%로 전체 1위를 기록했으며, MMTEB Retrieval에서는 75.5%를 기록했다.
  • 1B BF16 모델은 RTEB 72.4%, MMTEB Retrieval 71.0%를 기록했고 이전 1B 모델보다 각 평가의 오류율을 27%와 28% 줄였다.
  • Nemotron 3 Ultra 검색 에이전트 평가에서는 더 정확한 임베딩 모델이 관련 근거를 더 일찍 찾아 반복 검색과 추론 단계를 줄였으며, 8B 모델이 가장 높은 평균 정확도와 가장 낮은 추정 토큰 비용을 보였다.
  • 1B NVFP4 모델은 Blackwell에서 BF16 대비 최대 2배 처리량과 99% 이상의 검색 정확도 유지를 목표로 하며, 제품군은 오픈 가중치·데이터셋·학습 레시피와 32k 문맥 창, 다국어·코드 검색, 다양한 배포 경로를 제공한다.

🧩 주요 포인트

  1. 검색 정확도 향상 → 관련 근거를 더 일찍 제공해 에이전트의 재검색, 추가 추론, 문맥 검사에 쓰이는 토큰을 줄이는 효과로 연결됐다.
  2. B 품질 중심 모델과 1B 효율 중심 모델의 병행 → 고정밀 기업 검색부터 비용·지연시간·처리량 중심 서비스까지 서로 다른 운영 조건을 선택할 수 있게 했다.
  3. 오픈 가중치와 조정·증류 레시피, 즉시 사용 가능한 서빙 통합 → 자체 데이터에 대한 도메인 적응과 기존 검색 인프라 도입을 함께 지원하는 배포 전략을 구성했다.

🧠 상세 정리

1. 에이전트 검색의 문제와 제품군 공개

다단계 에이전트 워크플로에서 검색은 이후 판단과 추론에 사용할 문맥을 결정하는 출발점이다. 원문은 부정확한 검색이 관련 없는 정보를 가져오고, 에이전트의 재검색을 유발하며, 토큰 예산을 낭비하고, 잡음을 뒤쪽 추론 단계까지 전달한다고 문제를 규정한다. NVIDIA는 이를 겨냥해 프로덕션 RAG, 에이전트형 검색, 코드 검색, 에이전트 메모리에 사용할 수 있는 Nemotron 3 Embed 제품군을 공개했다. 제품군은 품질 기준점인 Nemotron-3-Embed-8B-BF16, 비용과 지연시간을 중시한 Nemotron-3-Embed-1B-BF16, Blackwell 기반 고처리량 환경을 겨냥한 Nemotron-3-Embed-1B-NVFP4로 구성된다. 세 모델을 함께 제공하는 목적은 하나의 크기로 모든 요구를 처리하기보다, 검색 품질과 메모리 사용량, 지연시간, 처리량 사이에서 배포 환경에 맞는 선택지를 제공하는 데 있다.

2. 프로덕션 검색을 위한 핵심 기능

Nemotron 3 Embed는 모델 가중치뿐 아니라 데이터셋과 학습 레시피도 공개해 조직이 모델을 직접 검사하고 조정하며 자체 인프라에 배포할 수 있도록 설계됐다. 모든 모델은 32k 문맥 창을 지원해 긴 문서, 큰 코드 문맥, 여러 대화 차례로 누적된 에이전트 기록을 검색할 때 입력이 잘리는 문제를 줄이는 데 초점을 둔다. 다국어 검색과 코드 검색을 지원하므로 글로벌 기업 데이터, 기술 문서, 여러 파일로 구성된 코드 저장소를 대상으로 사용할 수 있다. NeMo AutoModel 기반 미세 조정과 증류 레시피는 조직별 데이터에 맞춘 도메인 적응 및 모델 압축 경로를 제공한다. 공개 시점부터 Hugging Face에서 사용할 수 있고 NVIDIA NIM 마이크로서비스와 vLLM으로 배포할 수 있으며, 여러 인공지능 클라우드 및 추론 협력사를 통한 접근 경로도 제시됐다.

3. RTEB와 주요 검색 벤치마크 성과

평가는 검색 품질, 이후 에이전트 작업의 효율, 실제 배포상의 절충이라는 세 가지 차원으로 구성됐으며, 검색 정확도에는 평균 NDCG@10이 사용됐다. 비교 대상에는 RTEB, ViDoRe V3 Text, MMTEB Retrieval, LongEmbed가 포함됐고 이전 세대 Nemotron 기준 모델과의 차이도 함께 제시됐다. Nemotron-3-Embed-8B-BF16은 RTEB에서 78.5%로 전체 1위를 차지했으며 MMTEB Retrieval에서는 75.5%를 기록해 제품군의 품질 상한 역할을 했다. Nemotron-3-Embed-1B-BF16은 더 작은 배포 규모에서도 RTEB 72.4%와 MMTEB Retrieval 71.0%를 기록했다. 이전 1B 모델인 llama-nemotron-embed-vl-1b-v2와 비교하면 1B BF16 모델의 오류율은 RTEB에서 27%, MMTEB Retrieval에서 28% 감소한 것으로 보고됐다.

4. 검색 정확도와 에이전트 토큰 비용의 관계

에이전트 환경 평가는 Nemotron 3 Ultra로 구동되는 검색 에이전트에서 임베딩 모델만 바꾸는 방식으로 진행됐다. ViDoRe V3, BRIGHT, BrowseComp-Plus를 대상으로 평균 검색 정확도와 질의당 이후 에이전트 토큰 비용을 비교해, 검색기 선택이 전체 작업 과정에 미치는 영향을 측정했다. 더 정확한 검색기는 관련 근거를 앞선 단계에서 반환해 반복 검색, 불필요한 추론 차례, 추가 문맥 검사를 줄이는 결과를 보였다. 이 평가에서 Nemotron 3 Embed 모델들은 검색 정확도와 토큰 비용 사이의 경계를 개선했으며, 8B 모델은 평가 대상 가운데 가장 높은 평균 검색 정확도와 가장 낮은 추정 토큰 비용을 동시에 기록했다. 다만 비용은 실제 청구액을 직접 측정한 값이 아니라 Nemotron 3 Ultra의 입력·출력 토큰 수에 GPT-5.5 가격 공식을 적용해 계산한 추정치다.

5. Blackwell용 NVFP4 모델의 효율

고처리량 검색 서비스에서는 지연시간과 비용 목표를 맞추기 위해 작은 임베딩 모델을 선택하는 경우가 많지만, 일반적으로 검색 품질과 효율 사이의 절충이 발생한다. Nemotron-3-Embed-1B-NVFP4는 NVIDIA Blackwell 아키텍처의 네이티브 NVFP4 가속을 사용해 이 격차를 줄이도록 설계됐다. 선형 계층의 가중치와 활성값을 NVFP4로 양자화하고, 긴 입력에서도 정확도를 회복하도록 양자화 인식 증류를 적용했다. ViDoRe V3에서는 Qwen3-Embedding-0.6B와 EmbeddingGemma-300M을 포함한 소형 오픈 임베딩 기준 모델들과 정확도 및 서빙 효율을 비교했다. 원문에 따르면 Blackwell의 NVFP4 배포는 BF16보다 처리량이 최대 2배 높았으며, 메모리 사용량을 줄이면서 BF16 검색 정확도의 99% 이상을 유지했다.

6. 실제 서빙을 위한 최적화 NIM

원문은 모델 자체의 연산 효율만으로는 프로덕션 검색 성능을 보장할 수 없으며, 실제 요청 부하와 다양한 입력 길이 및 하드웨어에서도 서빙 계층이 효율을 유지해야 한다고 설명한다. 이를 위해 NVIDIA는 1B 모델용으로 최적화한 Nemotron 3 Embed NIM 마이크로서비스를 제품 공개와 동시에 제공했다. 이 NIM은 러스트 기반으로 구현됐으며 NVIDIA GB200과 RTX PRO 6000 그래픽 처리 장치에서 vLLM 체크포인트와 성능을 비교했다. 입력 시퀀스 길이 256과 1024 조건에서 NIM은 vLLM 체크포인트와 동등하거나 더 높은 서빙 성능을 기록한 것으로 제시됐다. 따라서 기사에서 주장하는 배포 효율은 모델 형식에만 국한되지 않고, 특정 하드웨어와 입력 길이에서 검증한 최적화 서빙 경로까지 포함한다.

7. 8B 모델의 구조 변환과 학습

Nemotron-3-Embed-8B-BF16은 Ministral-3-8B-Instruct-2512를 기반으로 하며, 원래의 인과적 디코더를 전체 입력 시퀀스를 함께 처리하는 양방향 인코더로 변환했다. 이 구조 변환은 다음 토큰 생성이 아니라 문서와 질의 전체의 표현을 계산하는 검색 작업에 맞추기 위한 것이다. 모델은 웹에서 수집한 텍스트 쌍과 합성 텍스트 쌍을 혼합한 데이터로 대조 사전 학습을 거쳤다. 이후 법률, 금융, 의료, 비즈니스, 교육 등 여러 분야의 선별된 다국어 검색 데이터셋으로 미세 조정됐다. 완성된 8B 모델은 제품군의 대표 품질 모델로 사용되며, 같은 개발 계열의 이전 8B 교사 체크포인트들은 효율적인 1B 모델을 증류하는 데 활용됐다.

8. 1B 모델의 가지치기·증류 과정과 사양

1B 모델은 처음부터 작은 검색기로 학습된 것이 아니라, Ministral-3-3B-Instruct-2512에 양방향 변환을 적용해 만든 3B 검색기에서 출발했다. 먼저 NVIDIA ModelOpt의 mcore_minitron 신경망 구조 탐색 엔진이 은닉 폭, 순방향 신경망 크기, 어텐션 헤드 수, 깊이를 제한된 매개변수 예산 안에서 탐색해 3B 모델을 2B 중간 모델로 압축했다. 이어 8B 교사 모델과 학생 임베딩을 정렬하기 위해 다국어·도메인 내 검색 데이터에 코사인 거리 손실과 평균제곱오차 손실을 함께 적용했고, 같은 가지치기와 증류 절차를 다시 수행해 최종 1.14B 모델을 만들었다. 마지막 학습은 1024토큰 문맥에서 폭넓은 다국어 정렬을 복원한 뒤, 4096토큰 문맥과 장문 합성·추론 데이터를 추가하는 두 단계 일정으로 진행됐다. 완성 모델의 명시된 최대 문맥 창은 32k이며, 8B 모델의 임베딩 차원은 4096, 두 1B 모델은 2048이고 세 모델 모두 평균 풀링과 질의·문서 입력 접두사를 사용한다. 목표 하드웨어는 각각 일반 그래픽 처리 장치 추론, 저지연 중앙처리장치·그래픽 처리 장치, NVIDIA Blackwell 및 GB200 환경으로 구분됐다.

9. 기업 협력사의 초기 평가와 통합

기업용 독립 소프트웨어 공급사, 인공지능 기업, 데이터 플랫폼 기업, 메모리 서비스 제공사들은 Nemotron 3 Embed를 에이전트형 검색, 에이전트 메모리, 코드 검색, 프로덕션 추론 작업에서 평가하고 있다. Automation Anywhere는 자사의 문맥 지능 그래프와 질의응답 평가에서 기존 모델보다 개선된 초기 결과를 확인했다고 밝혔으며, 기업 에이전트의 정확성과 신뢰성을 높일 가능성에 주목했다. Boomi는 1B와 8B 변형이 품질, 지연시간, 배포 조건을 환경별로 조절할 수 있게 한다며 에이전트형 검색에서 강한 초기 성능을 보고했다. Elastic은 별도 통합 코드를 작성하지 않고 벡터 검색과 RAG 응용 프로그램을 구축할 수 있도록 Nemotron 3 Embed를 Elasticsearch Inference API에 통합하고 있으며, IBM도 watsonx.data 기반 개념 검증에서 유망한 초기 결과를 확인했다. 이러한 내용은 실제 기업 환경에서의 도입 경로를 보여주지만, 원문에서도 대부분 초기 평가나 개념 검증 단계의 결과로 표현돼 있다.

🧾 핵심 주장 / 시사점

  • 이 평가에서 임베딩 모델은 단순한 검색 정확도 구성요소가 아니라 에이전트가 수행하는 재검색과 추론 횟수까지 좌우했으며, 검색 품질이 전체 에이전트 작업의 토큰 효율과 연결된다는 점이 확인됐다.
  • 1B 모델의 성능은 작은 모델을 독립적으로 학습한 결과가 아니라 3B 기반 구조 탐색, 두 차례의 가지치기, 8B 교사 증류, 단계적 문맥 확장을 결합해 품질 손실을 줄인 압축 과정에서 나왔다.
  • 성능 수치는 평가 데이터셋, 비용 추정 공식, Blackwell 계열 하드웨어, 입력 길이 등 명시된 조건에 기반하므로 검색 품질·비용·처리량 주장은 해당 측정 범위와 함께 해석해야 한다.

✅ 액션 아이템

  • Nemotron-3-Embed-8B-BF16의 RTEB 78.5% 성능을 기준으로 프로덕션 RAG·에이전트형 검색의 정확도 우선 적용 범위를 정의한다.
  • 1B BF16과 1B NVFP4의 RTEB 점수와 Blackwell 처리량 목표를 비교해 비용·지연시간 중심 서비스용 임베딩 우선순위를 정한다.
  • Nemotron 3 Ultra 검색 에이전트 평가의 추정 토큰 비용 결과를 기준으로 검색 정확도 향상이 재검색·추론 단계 축소로 이어지는지 점검한다.

❓ 열린 질문

  • Nemotron-3-Embed-8B-BF16이 보인 가장 높은 평균 정확도와 가장 낮은 추정 토큰 비용이 실제 에이전트형 검색에서도 유지되는 조건은 무엇인가?
  • 1B NVFP4가 Blackwell에서 BF16 대비 최대 2배 처리량을 낼 때 99% 이상 검색 정확도를 유지하는 범위는 어디인가?
  • 오픈 가중치와 조정·증류 레시피로 자체 데이터에 도메인 적응할 때 MMTEB Retrieval 71.0%~75.5% 대비 어떤 기준이 필요한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.