Multi-Vector Retriever for RAG on tables, text, and images
Quick Summary
LangChain은 검색용 표현과 답변 생성용 원본을 분리하는 멀티 벡터 검색기로 텍스트·표·이미지를 다루는 RAG와 로컬 실행 구성을 제시했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
LangChain은 검색용 표현과 답변 생성용 원본을 분리하는 멀티 벡터 검색기로 텍스트·표·이미지를 다루는 RAG와 로컬 실행 구성을 제시했다.
📌 핵심 요약
- LangChain은 텍스트와 표를 다루는 반정형 RAG, 이미지를 포함하는 멀티모달 RAG, 로컬에서 실행하는 비공개 멀티모달 RAG를 위한 세 가지 쿡북을 공개했다.
- 멀티 벡터 검색기는 검색용 요약과 답변 생성용 원본을 분리하며, 요약의 의미 유사도로 검색한 뒤 연결된 원본을 LLM에 전달할 수 있다.
- Unstructured로 문서를 텍스트·표·이미지 요소로 분리하고, 표 요약으로 검색한 뒤 원본 표를 답변 생성에 사용해 단순 청킹의 표 분할 문제에 대응한다.
- 이미지 RAG에는 멀티모달 임베딩과 원본 이미지 활용, 이미지의 텍스트 요약 활용, 이미지 요약 검색과 원본 이미지 활용이라는 세 가지 접근법이 제시됐다.
- 원문은 LLaVA 7b로 이미지 요약을 생성하는 두 번째 접근법을 시험했으며, LLaVA 7b·Chroma·Nomic의 GPT4All 임베딩·멀티 벡터 검색기·Ollama를 통한 LLaMA2-13b-chat으로 전체 파이프라인을 소비자용 노트북에서 로컬 실행할 수 있다고 설명했다.
🧩 주요 포인트
- 검색용 표현과 원본의 분리 → 검색에는 간결한 요약을 활용하면서 답변 생성에는 원본의 문맥을 제공할 수 있다.
- 텍스트·표·이미지별 표현을 연결하는 검색 구조 → 서로 다른 데이터 유형을 멀티 벡터 검색기라는 공통 틀에서 다룰 수 있다.
- 원본 이미지 사용 여부와 로컬 실행 구성의 선택 → 답변 생성에 사용할 모델의 멀티모달 지원 여부와 데이터 프라이버시 요구가 구성 선택의 기준이 된다.
🧠 상세 정리
1. 배경과 기존 RAG 개선 방식
원문은 이미지·텍스트·표가 섞인 자료에 대해 자연스럽게 질문하고 답하는 것을 RAG의 중요한 목표로 제시한다. LLM이 새 정보를 얻는 방식으로 가중치 갱신과 프롬프트에 관련 문맥을 전달하는 RAG를 구분하며, 외부 데이터의 내용과 모델의 추론 능력을 결합하는 RAG가 특히 기업 데이터의 사실 회상에 유망하다고 설명한다. 기본 방식은 임베딩한 문서 청크에서 상위 K개를 검색해 모델에 전달하는 것이다. 개선 기법으로는 요약 임베딩, 검색 결과 주변 문맥 확장, 메타데이터 필터링, 임베딩 모델 미세 조정, 키워드 검색 뒤 의미 검색을 수행하는 두 단계 RAG를 소개한다. 그러나 구조화된 표와 비구조화 텍스트가 함께 있거나 이미지까지 포함된 문서를 처리하는 문제는 여전히 과제로 남아 있다고 짚는다.
2. 멀티 벡터 검색기의 핵심 원리
멀티 벡터 검색기는 답변 생성에 사용할 문서와 검색에 사용할 참조 표현을 분리한다. 긴 문서의 경우 벡터 유사도 검색에 적합한 요약을 만들고 이를 검색 대상으로 사용할 수 있다. 검색 결과가 선택되면 요약에 연결된 전체 문서를 LLM에 전달하므로, 답변 생성 단계에서 요약만 제공할 때 빠질 수 있는 원문 문맥을 유지한다. 이 구조에서는 검색에 적합한 표현과 답변에 필요한 자료가 반드시 동일할 필요가 없다. 원문은 이러한 원리를 일반 텍스트에 한정하지 않고 표와 이미지에도 적용할 수 있다고 설명하며, 서로 다른 콘텐츠 유형이 섞인 문서를 처리하는 세 가지 쿡북의 공통 기반으로 삼는다.
3. 문서 분해와 반정형 표 검색
이 접근법을 적용하려면 먼저 문서를 콘텐츠 유형별로 분리해야 하며, 원문은 여러 파일 형식에서 표·이미지·텍스트를 추출하는 도구로 Unstructured를 소개한다. PDF 처리 예시에서는 내장 이미지 블록을 제거한 뒤 YOLOX 레이아웃 모델로 표의 경계 상자와 하위 절 후보인 제목을 식별한다. 이어 제목 아래의 텍스트를 모으고 최소 청크 크기 같은 사용자 설정에 따라 후속 처리용 텍스트 블록으로 나눈다. 단순 청킹은 표를 중간에서 나눌 수 있으므로, 반정형 데이터에서는 추출한 표 요소의 요약을 생성해 자연어 검색에 활용한다. 사용자 질문과 표 요약 사이의 의미 유사도로 검색 결과가 선택되면 원본 표를 LLM에 전달해 답변을 생성한다.
4. 이미지 RAG의 세 가지 접근법
원문은 GPT4-V, LLaVA, Fuyu-8b 같은 멀티모달 모델을 배경으로 이미지 RAG의 세 가지 접근법을 제시한다. 첫 번째는 CLIP 같은 멀티모달 임베딩으로 이미지와 텍스트를 함께 표현하고 유사도 검색한 뒤, 저장소에 연결된 원본 이미지와 텍스트 청크를 멀티모달 LLM에 전달하는 방식이다. 두 번째는 멀티모달 LLM으로 이미지의 텍스트 요약을 만들고 텍스트 임베딩으로 검색하며, 답변 생성에 멀티모달 LLM을 쓰기 어려운 경우 이미지 자체를 문서 저장소에서 제외한다. 이 경우 답변 생성에는 저장소의 원본 텍스트 청크나 표를 참조한다. 세 번째는 이미지 요약을 텍스트로 임베딩하고 검색하되 원본 이미지와의 연결을 유지해, 답변 생성 시 원본 이미지와 텍스트를 멀티모달 LLM에 전달한다. 원문은 세 번째 방식을 멀티모달 임베딩을 사용하지 않으려는 경우에 적합한 선택으로 설명한다.
5. LLaVA 7b 이미지 요약 실험
저자들은 두 번째 접근법을 LLaVA 7b로 시험해 이미지의 텍스트 요약을 생성했다. 원문은 LLaVA가 llama.cpp에 추가되면서 소비자용 노트북에서도 실행할 수 있게 됐다고 설명하고, 메모리 32GB의 Mac M2 Max에서 초당 약 45토큰이라는 실행 사례를 제시한다. 예시 이미지는 튀긴 닭고기 조각을 세계지도처럼 배치한 것으로, 모델은 대륙과 국가를 닮은 배치와 장난스러운 시각적 표현을 요약했다. 저자들은 이 사례를 이미지의 유머를 포착한 결과로 소개한다. 생성된 이미지 요약은 표와 텍스트의 요약과 함께 멀티 벡터 검색기에 저장되며, 이를 활용하는 멀티모달 RAG 쿡북이 제공된다.
6. 로컬 실행 구성과 적용 범위
데이터 프라이버시가 중요한 경우에는 오픈 소스 구성요소를 이용해 전체 RAG 파이프라인을 소비자용 노트북에서 로컬로 실행할 수 있다고 원문은 설명한다. 제시된 구성은 이미지 요약용 LLaVA 7b, 벡터 저장소 Chroma, Nomic의 GPT4All 임베딩, 멀티 벡터 검색기, Ollama를 통한 답변 생성용 LLaMA2-13b-chat이다. 이 구성을 위한 비공개 멀티모달 RAG 쿡북도 별도로 소개한다. 결론에서는 멀티 벡터 검색기가 텍스트와 표를 포함하는 반정형 RAG뿐 아니라 이미지가 추가된 데이터에도 적용될 수 있다는 점을 강조한다. 또한 전체 파이프라인의 로컬 실행 가능성을 정리하고, 앞서 제시한 세 가지 멀티모달 접근법을 향후 쿡북에서 다룰 방향으로 언급한다.
🧾 핵심 주장 / 시사점
- 검색 품질을 위한 요약과 답변의 근거가 되는 원본을 분리하면, 검색 단계와 답변 생성 단계에 서로 다른 표현을 사용할 수 있다.
- 표와 이미지의 요약을 검색에 활용하는 공통점이 있어도, 답변 생성에 원본 표나 원본 이미지를 전달하는지는 각 접근법에 따라 구분해야 한다.
- 이미지의 텍스트 요약을 활용하는 구성은 답변 생성 모델이 원본 이미지를 직접 처리하기 어려운 경우에도 이미지에서 얻은 정보를 검색에 활용하는 경로를 제공한다.
✅ 액션 아이템
- 텍스트·표·이미지의 포함 여부와 로컬 실행 필요에 따라 세 가지 쿡북의 적용 범위 검토.
- 멀티 벡터 검색기의 검색용 요약과 답변 생성용 원본 연결 방식을 적용 대상에 맞춰 검토.
- 답변 생성 모델의 멀티모달 지원 여부와 데이터 프라이버시 요구를 기준으로 원본 이미지 사용 여부 및 로컬 실행 구성 검토.
❓ 열린 질문
- 적용 대상 문서에는 텍스트·표·이미지 중 어떤 데이터 유형이 포함되는가?
- 답변 생성 모델의 멀티모달 지원 여부를 고려할 때 원본 이미지를 직접 활용할 것인가, 이미지의 텍스트 요약을 활용할 것인가?
- 데이터 프라이버시 요구에 따라 전체 파이프라인의 로컬 실행이 필요한가?