Expert Support case study: Bolstering a RAG app with LLM-as-a-Judge
Quick Summary
Digital Green은 농업 RAG 챗봇 Farmer.chat의 응답 품질을 대규모로 평가하기 위해 LLM as a Judge 체계를 구축하고, 충실도와 답변률의 균형을 기준으로 생성 모델을 비교·선정했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Digital Green은 농업 RAG 챗봇 Farmer.chat의 응답 품질을 대규모로 평가하기 위해 LLM-as-a-Judge 체계를 구축하고, 충실도와 답변률의 균형을 기준으로 생성 모델을 비교·선정했다.
📌 핵심 요약
- Farmer.chat은 약 4만 6천 건의 농업 연구 문서와 보고서를 기반으로 소농과 농업지도사에게 지역·작물·언어 맥락에 맞는 신뢰성 높은 조언을 제공하려는 RAG 챗봇이다.
- 시스템은 문서 전처리와 의미 기반 청킹, 임베딩 및 벡터 데이터베이스 저장, 관련 정보 검색, LLM 답변 생성, 사용자 의도 파악과 도구 호출을 담당하는 에이전트로 구성된다.
- 운영 규모가 2만 명 이상의 농민과 34만 건 이상의 질의로 커지자, 연구팀은 정답이 하나로 결정되지 않는 답변의 명료성·관련성·충실도를 평가하기 위해 LLM-as-a-Judge를 도입했다.
- 평가 항목에는 프롬프트 명료성, 질문 유형, 답변된 질의의 비율, RAG 정확도가 포함되며, RAG 정확도는 생성 답변을 원자적 사실 진술로 나눈 뒤 검색 문맥에서 각 진술을 도출할 수 있는지 이진 판정하는 방식으로 측정했다.
- 700건이 넘는 표본 질의로 네 모델을 비교한 결과 Gemini-1.5-Pro가 충실도에서는 가장 높았지만, 연구팀은 미응답률이 낮으면서 충실도도 높은 Gemini-1.5-Flash를 최종 선택했다.
🧩 주요 포인트
- Farmer.chat은 약 4만 6천 건의 농업 연구 문서와 보고서를 기반으로 소농과 농업지도사에게 지역·작물·언어 맥락에 맞는 신뢰성 높은 조언을 제공하려는 RAG 챗봇이다.
- 시스템은 문서 전처리와 의미 기반 청킹, 임베딩 및 벡터 데이터베이스 저장, 관련 정보 검색, LLM 답변 생성, 사용자 의도 파악과 도구 호출을 담당하는 에이전트로 구성된다.
- 운영 규모가 2만 명 이상의 농민과 34만 건 이상의 질의로 커지자, 연구팀은 정답이 하나로 결정되지 않는 답변의 명료성·관련성·충실도를 평가하기 위해 LLM-as-a-Judge를 도입했다.
- 평가 항목에는 프롬프트 명료성, 질문 유형, 답변된 질의의 비율, RAG 정확도가 포함되며, RAG 정확도는 생성 답변을 원자적 사실 진술로 나눈 뒤 검색 문맥에서 각 진술을 도출할 수 있는지 이진 판정하는 방식으로 측정했다.
- 700건이 넘는 표본 질의로 네 모델을 비교한 결과 Gemini-1.5-Pro가 충실도에서는 가장 높았지만, 연구팀은 미응답률이 낮으면서 충실도도 높은 Gemini-1.5-Flash를 최종 선택했다.
🧠 상세 정리
1. 소농 지원의 규모와 정보 접근 문제
전 세계에는 약 5억 명의 소농이 있으며, 이들은 세계 식량 안보에서 중요한 역할을 담당한다. 농민이 수확량을 높이고 적절한 결정을 내리려면 정확한 농업 정보를 필요한 시점에 제공받아야 하지만, 이를 지원하는 농업지도 인력은 수요에 비해 부족하다. 인도에만 약 30만 명의 농업지도사가 있으나, 일반적으로 지도사 한 명이 농민 약 1천 명을 상대하는 구조여서 인력만으로 모든 요구를 처리하기 어렵다. 이에 CGIAR 주도의 GAIA 프로젝트는 Hugging Face의 전문가 지원과 Digital Green의 현장 경험을 결합해, 파트너십과 기술을 통해 농민 및 농업지도사의 정보 접근성을 확장하고자 했다.
2. Farmer.chat과 농업 지식 기반 구축
GAIA의 목표는 GARDIAN 포털에 수십 년 동안 축적된 약 4만 6천 건의 농업 연구 논문과 보고서를 농민이 실제로 활용할 수 있는 형태로 전달하는 것이다. Digital Green은 승인되고 선별된 자료를 근거로 개인화된 농업 조언을 제공하기 위해 RAG 기반 Farmer.chat을 개발했다. 지식 기반 구축 과정에서는 Scio가 관리하는 API를 이용해 PDF 문서를 수집하고, 주제를 관련 지역별로 자동 분류한 뒤 의미적으로 유사한 자료를 묶었다. 이후 의미가 비슷한 문장들을 하나의 텍스트 청크로 구성하고, 임베딩 모델로 각 청크를 벡터화해 QdrantDB에 저장함으로써 사용자 질문과 가까운 근거를 검색할 수 있게 했다.
3. RAG 파이프라인과 사용자 대면 에이전트
RAG 파이프라인은 답변이 외부의 임의 지식이 아니라 준비된 농업 자료에 근거하도록 만드는 핵심 계층이다. 정보 검색 단계에서는 사용자 질의와 관련된 텍스트 청크를 벡터 데이터베이스 API를 통해 가져오고, 생성 단계에서는 검색된 청크와 사용자 질문을 LLM에 전달해 사람이 이해하기 쉬운 답변을 만든다. 사용자 대면 계획 에이전트는 GPT-4o를 사용하며, 사용자의 의도를 파악하고 추가 정보가 필요한지 판단한 뒤 질문이 명확해질 때까지 대화를 이어간다. 요구가 충분히 구체화되면 실행 에이전트를 호출하며, ReAct 기반 프롬프트와 추가 대화, RAG 질의응답, 동영상 검색, 날씨, 작물표 등의 도구를 활용해 결과를 분석하고 응답한다.
4. 대규모 운영이 만든 평가 과제
Farmer.chat은 여러 언어와 지역, 작물, 사용 사례를 다뤄야 하며, 농장 단위의 맥락과 농민이 이해할 수 있는 표현을 유지하면서도 신뢰할 수 있는 출처에 근거한 정보를 제공해야 한다. 지식 기반, 검색, 생성, 계획 에이전트, 외부 도구처럼 구성 요소가 많기 때문에 어느 한 부분의 변화도 정확성이나 답변 범위 등 성능의 다른 측면에 큰 영향을 줄 수 있다. 서비스는 1년 동안 2만 명이 넘는 농민에게 제공되며 34만 건 이상의 질의를 처리하는 규모로 성장했다. 이에 연구팀은 단순한 처리량이나 응답 속도를 넘어, 정답이 결정론적으로 정해지지 않는 답변의 간결성·정밀성·관련성과 사용자 경험을 반복적으로 평가할 수 있는 체계가 필요하다고 판단했다.
5. LLM-as-a-Judge의 설계 원칙과 평가 항목
LLM-as-a-Judge는 평가할 작업과 기준, 정수 점수 척도를 명확히 정의한 뒤 다른 LLM이 입력이나 출력을 채점하도록 하는 방식이다. Farmer.chat 연구팀은 사용자 질문의 의도와 요청이 명확한지, 주제가 구체적인지, 대상 개체와 속성이 충분히 특정됐는지를 각각 1점부터 3점까지 평가하고 평균을 반올림해 프롬프트 명료성 점수를 만들었다. 또한 질문을 기억·이해·적용·분석·평가·창작의 여섯 인지 범주로 분류하고, 전체 질문 가운데 챗봇이 실제로 답변한 비율도 추적했다. 여기에 검색된 정보와 생성된 응답이 사용자 질문에 충실하고 관련성이 있는지를 판단하는 RAG 정확도를 결합해, 답변 개수뿐 아니라 응답 품질과 사용자가 자신의 필요를 표현하는 방식까지 분석했다.
6. 원자적 사실 판정을 통한 RAG 정확도 측정
RAG 정확도 평가는 RAGAS 라이브러리에서 영감을 받은 자연어 추론 형태의 판정 프롬프트를 사용하며, 각 사실 진술에 0 또는 1의 점수를 부여한다. 다른 LLM 호출이 생성 답변을 원자적인 사실 진술들로 분해하면, 판정 LLM은 답변 생성에 사용된 입력 청크를 문맥으로 받아 각 진술을 그 문맥에서 도출할 수 있는지 확인한다. 진술이 문맥에서 도출되면 1점, 도출할 수 없으면 0점이며, 문맥 없이 진술만 존재할 때도 0점으로 처리한다. 진술과 문맥이 모두 없는 경우에는 1점으로 정의해 판정 규칙을 명시적으로 고정했다. 연구팀은 약 360개 질문을 대상으로 이 결과를 인간 평가와 비교했고, LLM 판정이 인간 평가와 높은 상관관계를 보인다는 점을 확인해 대량의 문서와 질의를 확장성 있게 평가할 수 있는 기반을 마련했다.
7. 700건 이상 질의로 수행한 모델 벤치마크
연구팀은 여러 작물 가치사슬과 월별 시점을 무작위로 섞은 700건 이상의 사용자 질의 표본을 만들고, 프롬프트를 모델별로 변경하지 않은 채 GPT-4-Turbo, Llama-3-70B-Instruct, Gemini-1.5-Pro, Gemini-1.5-Flash를 비교했다. 충실도는 Gemini-1.5-Pro가 91%로 가장 높았고, Gemini-1.5-Flash가 89%, GPT-4-Turbo가 88%, Llama-3-70B가 78%로 뒤를 이었다. 관련성은 Gemini-1.5-Pro가 88%로 가장 높았지만 미응답률도 19.4%였으며, GPT-4-Turbo의 미응답률은 21.9%였다. 반면 Llama-3-70B와 Gemini-1.5-Flash의 미응답률은 각각 0.3%와 4.5%로 낮아, 충실도만 볼 때와 실제로 얼마나 많은 질문에 답했는지를 함께 볼 때의 모델 순위가 달라졌다.
8. 평가 지표가 이끈 최종 모델 선택
벤치마크에서 Gemini-1.5-Pro는 사실적으로 정확한 답변의 비율만 보면 가장 우수했지만, 상당한 비율의 질문에 답하지 않았다는 한계가 함께 나타났다. Llama-3-70B는 거의 모든 질문에 답했으나 충실도는 네 모델 가운데 가장 낮았고, Gemini-1.5-Flash는 89%의 높은 충실도와 4.5%의 낮은 미응답률을 동시에 기록했다. 연구팀은 이처럼 서로 충돌할 수 있는 충실도와 답변률을 함께 검토한 끝에, 두 요소의 절충이 가장 우수한 Gemini-1.5-Flash를 선택했다. 이 사례에서 LLM-as-a-Judge 지표는 사용자 질문의 문제, RAG 파이프라인의 품질 저하 지점, 모델별 장단점을 구체적으로 드러내며 Farmer.chat의 개발 선택지를 탐색하는 기준 역할을 했다.
🧾 핵심 주장 / 시사점
- RAG 모델을 선택할 때 충실도 하나만 최적화하면 미응답이 많은 모델을 선택할 수 있으므로, 답변률과 결합된 지표를 함께 봐야 실제 서비스 효용을 판단할 수 있다.
- 생성 답변 전체를 한 번에 평가하는 대신 원자적 사실 진술로 분해하고 각 진술이 검색 문맥에서 도출되는지 판정하면, 근거 충실도를 명시적인 이진 규칙으로 측정할 수 있다.
- LLM-as-a-Judge는 모델 출력뿐 아니라 사용자 질문의 명료성과 인지적 유형도 평가하므로, 지식 기반이나 생성 모델의 개선과 사용자 대화 설계의 개선을 구분하는 데 활용될 수 있다.
✅ 액션 아이템
- RAG 평가 항목을 프롬프트 명료성, 질문 유형, 답변된 질의 비율, RAG 정확도로 고정해 비교 지표를 통일한다.
- 답변률과 충실도 균형을 기준으로 Gemini-1.5-Flash와 경쟁 모델을 700건 이상 표본으로 반복 비교한다.
- Farmer.chat 파이프라인을 문서 전처리, 의미 기반 청킹, 임베딩·벡터 DB, 검색, 답변 생성, 의도 파악·툴 호출로 분리해 병목을 점검한다.
❓ 열린 질문
- 원자적 사실 진술 기반 RAG 정확도 판정이 복합형 질문에서 맥락 누락을 얼마나 감지하지 못할 수 있는가?
- 질문 유형별로 설정한 평가 항목 가중치를 어느 방식으로 조정해야 충실도와 관련성 판단이 안정적인가?
- 운영 규모 확대 상황에서 미응답률이 낮으면서 충실도도 유지되는 모델 선정 기준은 어디에서 설정되어야 하는가?