Multi-modal RAG on slide decks
Quick Summary
Datadog 슬라이드의 10개 질문 평가에서 이미지 요약 기반 멀티 벡터 검색은 정확도 90%로 멀티모달 임베딩 60%와 텍스트 전용 RAG 20%를 앞섰지만, 요약 사전 생성에 따른 복잡성과 비용이 발생했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Datadog 슬라이드의 10개 질문 평가에서 이미지 요약 기반 멀티 벡터 검색은 정확도 90%로 멀티모달 임베딩 60%와 텍스트 전용 RAG 20%를 앞섰지만, 요약 사전 생성에 따른 복잡성과 비용이 발생했다.
📌 핵심 요약
- 슬라이드용 멀티모달 RAG는 사용자 질문과 관련된 슬라이드 이미지를 검색한 뒤 GPT-4V에 전달해 시각 정보를 반영한 답변을 생성한다.
- 멀티모달 임베딩 방식은 슬라이드 이미지를 직접 임베딩하며, 이미지 요약 기반 멀티 벡터 검색은 GPT-4V가 만든 요약을 텍스트로 임베딩하고 원본 이미지와 연결한다.
- Datadog 실적 발표 자료의 시각 정보를 바탕으로 만든 10개 질문을 LangSmith로 평가한 결과, CoT 정확도는 텍스트 전용 RAG 20%, 멀티모달 임베딩 60%, 이미지 요약 기반 멀티 벡터 검색 90%였다.
- 정확한 이미지가 검색되면 GPT-4V는 대체로 정답을 생성했으며, 핵심 난점은 올바른 슬라이드 검색이었다. 이미지 요약은 검색 성능을 높였지만 사전 생성 비용과 구현 복잡성을 더했다.
- LangChain은 공개 평가 자료와 Chroma·OpenCLIP 기반 실행 템플릿을 제공했으며, 시각적으로 유사한 슬라이드의 검색 개선을 위해 다양한 OpenCLIP 모델 실험을 제안했다.
🧩 주요 포인트
- 시각 맥락 보존 → Datadog의 10개 질문 평가에서 멀티모달 방식이 텍스트 전용 RAG보다 높은 정확도를 기록해 슬라이드 시각 정보의 활용 가치를 보여줌.
- 검색 표현 선택 → 이미지 직접 임베딩은 설계가 단순하고, 이미지 요약 기반 멀티 벡터 검색은 세부 내용을 텍스트로 표현해 검색을 개선하는 대신 비용과 복잡성을 높임.
- 올바른 슬라이드 검색이 핵심 난점 → GPT-4V의 답변 생성에 앞서 시각적으로 유사한 슬라이드를 구분하는 검색 성능이 주요 개선 과제로 드러남.
🧠 상세 정리
1. 슬라이드의 시각 정보로 확장하는 RAG
RAG는 질문에 관련된 문서를 검색해 LLM의 문맥에 넣음으로써 대화형 서비스나 질의응답을 구현하는 방식이다. 기존 RAG 앱은 주로 텍스트에 집중했지만, 투자자 발표와 사내 커뮤니케이션에 쓰이는 슬라이드에는 시각적 형태로 전달되는 정보도 많다. 원문은 GPT-4V 같은 멀티모달 LLM의 등장으로 이러한 시각 콘텐츠를 RAG에 활용할 가능성이 열렸다고 설명한다. 이를 검토하기 위해 슬라이드 이미지를 검색하는 두 가지 설계를 제시하고, 공개 벤치마크로 성능과 절충점을 비교한다. 이어서 실제 발표 자료로 멀티모달 RAG를 시험할 수 있는 실행 템플릿을 소개한다.
2. 이미지를 직접 검색하는 멀티모달 임베딩
첫 번째 설계는 슬라이드를 이미지로 추출하고 멀티모달 임베딩으로 각 이미지를 벡터화하는 방식이다. 사용자 질문에 관련된 슬라이드 이미지를 검색한 뒤, 검색 결과를 GPT-4V에 전달해 최종 답변을 생성한다. 텍스트 기반 RAG와 유사한 처리 흐름을 따르므로 설계가 비교적 단순하다는 장점이 있다. 원문은 이 접근에 사용할 수 있는 Chroma와 OpenCLIP 임베딩 기반 구현 예제를 앞서 공개했다고 설명한다. 다만 이용 가능한 멀티모달 임베딩 선택지가 제한적이고, 시각적으로 비슷한 그래프나 표를 구별해 올바른 슬라이드를 찾는 능력에는 의문이 남는다고 지적한다.
3. 이미지 요약을 활용하는 멀티 벡터 검색
두 번째 설계는 슬라이드를 이미지로 추출한 다음 GPT-4V로 각 이미지의 요약을 생성하는 방식이다. 생성한 요약을 텍스트 임베딩으로 변환하고 원본 이미지와 연결해 두면, 사용자 질문과 요약 사이의 유사도로 관련 이미지를 검색할 수 있다. 답변 생성 단계에서는 요약에 연결된 원본 이미지를 GPT-4V에 전달한다. 이 방식은 성숙한 텍스트 임베딩 모델을 활용하고 그래프나 도표의 세부 내용을 요약에 담을 수 있다는 장점이 있다. 반면 이미지별 요약을 미리 생성해야 하므로 직접 이미지 임베딩보다 처리 구조가 복잡해지고 추가 비용이 발생한다. 원문은 멀티 벡터 검색기를 활용한 구현 예제도 제공한다.
4. Datadog 공개 벤치마크와 정확도 비교
평가에는 시각 요소와 정성적 설명이 섞인 Datadog 실적 발표 자료를 사용했다. 슬라이드의 시각 콘텐츠에 기반한 질문과 답변 10개로 소규모 공개 LangChain 벤치마크를 만들고, LangSmith에서 두 멀티모달 방식과 텍스트 추출 기반 RAG를 비교했다. CoT 정확도는 텍스트 전용 상위 k개 검색 RAG가 20%, 멀티모달 임베딩이 60%, 이미지 요약 기반 멀티 벡터 검색이 90%였다. LangSmith의 비교 화면에서는 실험별 결과와 질문마다 검색된 콘텐츠를 나란히 검토할 수 있다. 원문은 평가 실행을 비교하는 공개 페이지와 각 질문·답변 및 관련 추적 기록을 자세히 살펴보는 자료도 제공한다.
5. 답변 생성보다 어려웠던 올바른 이미지 검색
두 멀티모달 방식은 이 평가에서 텍스트만 사용하는 RAG보다 높은 정확도를 보였으며, 원문은 이를 슬라이드 추론에서 시각 맥락을 보존하는 중요성과 연결한다. GPT-4V는 여러 시각 요소가 섞인 슬라이드에서 고객 수를 정확히 추출하는 등 이미지 속 구조화된 정보를 읽는 능력도 보여줬다. 올바른 이미지가 검색된 경우에는 대체로 질문에 정확히 답했지만, 그 이미지를 검색하는 과정이 핵심 난점이었다. 이미지 요약은 직접 멀티모달 임베딩보다 검색을 크게 개선했으나, 요약 사전 생성의 비용과 복잡성이 뒤따랐다. 이에 원문은 시각적으로 유사한 슬라이드를 구별하는 멀티모달 임베딩의 필요성을 강조하고, 다양한 OpenCLIP 모델을 실험할 대상으로 제안한다.
6. 실행 템플릿과 결과의 적용 범위
원문이 공개한 실행 템플릿은 Chroma와 OpenCLIP 멀티모달 임베딩을 사용해 슬라이드용 RAG를 시험할 수 있도록 구성됐다. 발표 자료를 업로드한 뒤 README에 안내된 두 명령으로 벡터 저장소를 만들고 대화형 실행 화면을 구동할 수 있다고 설명한다. 제시된 예시는 Datadog 발표 자료에 대한 대화와 올바른 슬라이드가 검색됐음을 보여주는 LangSmith 추적 기록을 함께 보여준다. 결론에서는 두 멀티모달 접근이 해당 벤치마크에서 텍스트 전용 RAG를 앞섰으며, 이미지 요약의 검색 개선에는 사전 생성 비용이 따른다는 점을 재확인한다. 또한 멀티모달 임베딩의 향후 성능 잠재력을 언급하면서도, 현재 선택지가 제한적이고 이번 실험에서는 이미지 요약 방식보다 성능이 낮았다고 구분한다.
🧾 핵심 주장 / 시사점
- 슬라이드 RAG에서는 시각 맥락을 유지하는 입력 설계가 중요하며, 해당 벤치마크의 정확도 차이가 이를 뒷받침한다.
- GPT-4V가 올바른 슬라이드에서 대체로 정답을 생성했다는 관찰은 검색 품질을 핵심 개선 대상으로 삼을 근거가 된다.
- 이미지 요약 방식의 90% 정확도는 Datadog의 10개 질문 평가 결과이며, 설계 선택에서는 검색 성능과 요약 생성 비용·복잡성을 함께 고려해야 한다.
✅ 액션 아이템
- Datadog의 10개 질문과 LangSmith 공개 평가 자료를 바탕으로 세 방식의 정확도 차이 검토.
- 이미지 요약 기반 멀티 벡터 검색의 검색 개선 효과와 사전 생성 비용·구현 복잡성을 함께 비교.
- 시각적으로 유사한 슬라이드의 검색 성능을 확인하기 위해 다양한 OpenCLIP 모델 실험.
❓ 열린 질문
- Datadog의 10개 질문 평가에서 이미지 요약 기반 멀티 벡터 검색과 멀티모달 임베딩의 정확도 차이는 어떤 질문에서 나타났는가?
- 이미지 요약 기반 멀티 벡터 검색의 성능 향상에 수반되는 사전 생성 비용과 구현 복잡성은 어느 정도인가?
- 다양한 OpenCLIP 모델은 시각적으로 유사한 슬라이드를 구분하는 검색 성능에서 어떤 차이를 보이는가?