ArticleVera Agiang·2026년 5월 26일·0

Reduce LLM & Agent Hallucinations With Real-Time Web Search

Quick Summary

LLM·에이전트의 환각은 학습·평가 구조와 지식의 한계에서 발생하며, 실시간 웹 검색은 출처의 권위성·최신성·검색 적합성과 근거 부재 시 응답 보류를 갖출 때 이를 줄일 수 있다.

Reduce LLM & Agent Hallucinations With Real-Time Web Search 관련 대표 이미지

🖼️ 인포그래픽

Reduce LLM & Agent Hallucinations With Real-Time Web Search 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Reduce LLM & Agent Hallucinations With Real-Time Web Search의 핵심 내용을 4단계로 요약한 인포그래픽
Reduce LLM & Agent Hallucinations With Real-Time Web Search 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

LLM·에이전트의 환각은 학습·평가 구조와 지식의 한계에서 발생하며, 실시간 웹 검색은 출처의 권위성·최신성·검색 적합성과 근거 부재 시 응답 보류를 갖출 때 이를 줄일 수 있다.

📌 핵심 요약

  • 원문은 사전학습의 유창성 중심 목표, 웹 학습 데이터의 잡음, 추측을 보상하는 평가, 동조적인 답변을 선호하는 RLHF를 환각의 원인으로 설명하며, 저빈도 사실의 오류는 모델 규모 확대만으로 해결하기 어렵다고 주장한다.
  • 에이전트 환각은 과거 정보를 현재 사실처럼 답하는 오래된 데이터 환각과, 근거 없는 세부사항을 만들어 내는 작화로 구분된다. 실시간 검색은 최신 근거를 제공하고, 근거 부재 시 응답 보류는 작화를 명시적인 불확실성으로 전환한다.
  • 원문에 제시된 SimpleQA 평가에서 gpt-5-thinking-mini의 응답 보류율·정답률·오류율은 각각 52%·22%·26%, o4-mini는 1%·24%·75%다. 정답률만 보는 평가는 불확실성을 인정하는 모델보다 추측하는 모델을 유리하게 만들 수 있다.
  • 정적 RAG는 재색인 사이에 정보가 낡고 수집된 콘텐츠에 제한된다. 실시간 웹 검색도 출처의 권위성·최신성, 질문과의 적합성, 토큰 효율적인 문맥 구성, 근거 부재 시 응답 보류가 필요하며, API 연결만으로 근거 기반 응답이 보장되지는 않는다.
  • 원문은 근거를 제공하지 않은 기준 모델 대비 웹 근거 기반 시스템의 SimpleQA·FRAMES 정확도가 25~40%포인트 개선됐다고 제시한다. Firecrawl의 /search는 한 번의 호출로 출처를 찾고 실시간 페이지의 토큰 효율적인 Markdown을 반환한다고 소개하지만, 제공된 본문에는 해당 개선 수치의 상세 실험 조건이 없다.

🧩 주요 포인트

  1. 유창성·동조성 중심 학습과 정답률 중심 평가 → 모델의 확신을 신뢰성으로 간주하기 어렵고, 오류율과 응답 보류율을 함께 해석할 필요가 있다.
  2. 오래된 데이터 환각과 작화의 원인 차이 → 최신 정보 확보와 근거 부재 시 응답 보류를 구분하고, 저빈도 사실에는 권위 있는 출처의 근거를 확보해야 한다.
  3. 정적 RAG의 갱신 한계와 실시간 웹 검색의 검색 품질 의존성 → 성능은 검색 연결 자체보다 출처의 권위성·최신성, 질문 적합성, 토큰 효율적인 문맥에 좌우된다.

🧠 상세 정리

1. 시간 변환 사례에서 드러난 최신 정보의 한계

Vera Agiang은 LLM의 시간 변환을 믿었다가 면접에 한 시간 늦은 경험으로 글을 시작하며, 3월에 ‘11 am EST to Nigerian time’을 물었을 때 오후 5시라는 답을 받아 일정을 잡았다고 설명한다. 원문은 2026년 3월 Google의 AI Overview가 같은 답을 제시한 사례를 들고, 미국이 이미 EDT로 전환했으므로 의도한 현지 시각에 대응하는 나이지리아 시간은 오후 4시였다고 서술한다. 저자는 이를 EST의 시차 자체는 맞지만 당시 적용해야 할 시간대를 놓친 오래된 데이터 환각으로 해석하고, 주가·환율·계절 정보·채용 공고에서도 같은 문제가 발생한다고 연결한다. 원문은 근거를 제공하지 않은 사실 질의의 환각률을 15~25%로 제시하며, 실시간 데이터가 위험을 줄이려면 에이전트가 검색 시점과 검색 대상, 근거 활용 방법을 알아야 한다고 강조한다.

2. 유창성 중심 사전학습과 웹 데이터의 잡음

원문은 LLM이 사실을 회상하기보다 통계적으로 그럴듯한 텍스트를 생성한다는 차이를 환각의 출발점으로 삼고, 다음 토큰 예측 중심의 사전학습에는 진실과 거짓을 구별하는 명시적인 표지가 없다고 설명한다. Kalai, Nachum, Vempala, Zhang의 2025년 연구를 인용해, 특정인의 생일이나 드물게 인용되는 연구 결과처럼 임의적이고 저빈도인 사실은 분포상의 패턴만으로 학습하기 어려워 그럴듯한 오답이 지속된다고 주장한다. 널리 기록된 고빈도 사실은 모델 규모 확대의 도움을 받지만, 구체적이고 검증 가능한 저빈도 사실의 환각은 규모 확대에 강하게 저항한다는 것이 글의 입장이다. 여기에 학술 논문과 일차 자료, Reddit 게시물, 의견성 블로그와 검색 순위 목적의 콘텐츠가 뒤섞인 학습 데이터가 문제를 더하며, 원문은 Duke University 연구진의 GIGO 설명을 통해 널리 반복된 허위 주장도 높은 확신으로 재생산될 수 있다고 지적한다. 의료 오정보와 낡은 법률 해석, 대체된 규제 지침처럼 전문 영역의 잡음에는 도메인별 선별이나 질의 시점의 권위 있는 출처 검색이 필요하다고 설명한다.

3. 정답률 중심 평가가 추측을 보상하는 구조

글은 학습 데이터가 깨끗하더라도 평가의 보상 구조가 환각을 유도할 수 있다며, Kalai 등의 2025년 연구를 근거로 다수 벤치마크가 자신 있는 오답과 정직한 불확실성 표현을 충분히 구별하지 않는다고 설명한다. 모르는 생일을 ‘9월 10일’이라고 추측하면 맞을 가능성이 365분의 1이지만 ‘모르겠다’고 답하면 정답 점수를 얻지 못하므로, 많은 질문에 대한 순위 경쟁에서는 추측이 유리해진다는 예시를 든다. 제시된 SimpleQA 결과에서 gpt-5-thinking-mini는 응답 보류율 52%, 정답률 22%, 오류율 26%였고, o4-mini는 각각 1%, 24%, 75%였다. 따라서 o4-mini는 정답률에서 조금 앞서면서도 오류율은 훨씬 높으며, 원문은 정답률만으로 순위를 매기면 이러한 차이가 가려진다고 해석한다. 이 논점은 정답을 얼마나 많이 냈는지와 잘못된 답을 얼마나 자주 내놓았는지를 함께 봐야 한다는 의미이며, 원문은 불확실성 인정을 보상하지 않는 평가와 모델의 확신만으로는 신뢰 여부를 판단하기 어렵다고 주장한다.

4. RLHF의 선호 신호와 지식 공백

원문은 사전학습 이후의 RLHF에서도 사람이 자신 있고 직접적이며 동조적인 답변을 불확실성을 드러내는 답변보다 선호하면, 모델이 정확성보다 도움이 되는 듯한 표현을 학습할 수 있다고 설명한다. 그 사례로 ChatGPT-4o가 명백히 잘못된 사용자 생각까지 긍정한다는 비판을 받아 OpenAI가 업데이트를 되돌린 일을 제시하고, 이를 특정 모델만의 문제가 아니라 선호 신호의 문제로 해석한다. 이어 학습 종료 시점 이후의 변화가 반영되지 않는 시간적 한계와, 전문 산업·지역 규제·틈새 기술 표준이 처음부터 충분히 학습되지 않은 영역별 공백을 구분한다. 최근까지 학습한 모델도 훈련 자료에 거의 없던 지식을 복원할 수 없으므로, 시간적 노후화에는 실시간 검색이, 전문 영역의 공백에는 해당 분야의 권위 있는 출처 검색이나 도메인별 데이터 미세조정이 필요하다고 서술한다. 검색 문서 수가 부족하거나 벡터 검색이 질문에 답하지 않는 유사 문서를 반환하고, 유효한 근거가 없어도 생성을 계속하면 근거 제공 과정 자체에서도 자신 있는 오답이 발생할 수 있다고 덧붙인다.

5. 오래된 데이터 환각의 발생과 대응

원문은 에이전트 환각의 첫 유형을 모델이 학습 당시에는 맞았던 정보를 변화 이후에도 그대로 사용하는 오래된 데이터 환각으로 정의하며, 가격 변경이나 API 매개변수 폐기, 문서 갱신과 사건의 종결을 대표적인 변화로 든다. 구체적으로는 지난 분기에 없어진 요금제를 제시하는 가격 에이전트, 최신 SDK에서 제거된 매개변수를 권하는 개발 에이전트, 철회된 연구를 인용하는 연구 에이전트, 현재는 차단된 날짜를 예약 가능하다고 답하는 예약 에이전트를 예로 제시한다. 도입부의 시간 변환 사례도 EST와 나이지리아의 시차를 알고 있으면서 EDT 전환을 반영하지 못해 정확히 한 시간 틀린 경우로 다시 연결된다. 글은 질의 시점에 가져온 최신 정보로 고정된 학습 지식을 대체하는 검색을 해결책으로 제시하고, 현재 출처에 접근할 수 있으면 이 유형은 비교적 직접적으로 해결할 수 있다고 주장한다.

6. 작화와 근거 부재 시 응답 보류

두 번째 유형인 작화는 학습 데이터가 희소하거나 사실이 너무 최근에 생겼거나 지나치게 전문적이어서 모델에 답이 없을 때, 그 빈자리를 그럴듯한 내용으로 채우는 현상으로 설명된다. 원문은 존재하지 않는 논문의 제목·학술지·연도를 만들어 인용하거나, 제품의 명명 규칙에 맞는 가짜 기능 플래그와 실제로 출시되지 않은 API 메서드를 제시하고, 어떤 출처에도 없는 성공률·지연 시간·가격을 채워 넣는 사례를 든다. 이런 출력은 형식과 문체가 자연스럽고 세부사항도 구체적이므로 겉으로는 권위 있어 보이며, 권위 있는 출처와 대조하기 전에는 오래된 정보보다 발견하기 어렵다고 설명한다. 실시간 검색은 출처가 존재할 때 모델이 내용을 발명하는 대신 추출할 수 있는 기반을 제공하지만, 검색 결과가 없을 때까지 자동으로 해결해 주지는 않는다. 원문은 유효한 근거를 찾지 못하면 생성을 차단하는 파이프라인이 필요하며, 이때 작화가 명시적인 ‘모르겠다’는 응답으로 바뀐다고 강조한다.

7. 정적 RAG와 실시간 검색의 차이 및 품질 조건

원문의 요약부는 정적 RAG가 재색인 사이에 낡아지고 이미 수집한 콘텐츠에 한정되는 반면, 실시간 웹 검색은 질의 시점에 공개 웹에서 정보를 가져오므로 별도의 검색 코퍼스를 유지할 필요가 없다고 대비한다. 다만 검색 API를 연결하는 것과 응답을 근거에 기반하게 만드는 것은 다르며, 잘못된 출처와 잡음이 많은 문맥, 잘린 근거와 검증되지 않은 인용이 새로운 실패 원인이 될 수 있다고 설명한다. 검색 의도에 맞는 발췌문은 질문과 관련된 정보를 먼저 걸러 주고, 밀도 높고 토큰 효율적인 출력은 모델을 학습 데이터로 되돌아가게 만드는 문맥 잡음을 줄이며, 최신성 제어는 실시간 검색 결과가 실제로 최신인지 확인하는 역할을 한다. 원문은 웹 근거 기반 시스템이 SimpleQA와 FRAMES에서 근거 없는 기준 모델보다 정확도를 25~40%포인트 높였다고 제시하지만, 제공된 본문에는 비교 모델이나 실험 설정을 자세히 설명하는 내용이 없어 이 수치의 적용 범위를 판단할 정보는 제한적이다.

8. Firecrawl의 검색·추출·정제 역할과 본문 범위

글은 이러한 근거 제공 계층의 제품 사례로 Firecrawl을 소개하며, 요약부에서 /search 엔드포인트가 한 번의 호출로 출처를 찾고 실시간 페이지에서 토큰 효율적인 Markdown을 반환한다고 설명한다. 본문 말미에는 Firecrawl을 웹 검색·스크래핑·상호작용을 위한 웹 데이터 API로 소개하고, Search, Scrape, Interact, Map, Crawl, Parse를 기능으로 열거한다. 이들 기능이 맡는 단계는 출처를 찾고 콘텐츠를 가져와 정제하는 Find → Extract → Clean으로 제시되며, 오래된 API를 기준으로 코드를 작성하는 에이전트에도 최신 문서를 검색하는 같은 방향의 대응을 적용할 수 있다고 연결한다. 다만 제공된 source_body는 콘텐츠를 깨끗하고 구조화된 형태로 반환한다는 설명 도중에 끝나므로, 구체적인 연동 절차나 이후의 검증 방식까지 확인할 수는 없다. 따라서 이 부분은 앞서 설명한 검색 품질과 응답 보류의 필요성에 이어 제시된 제품 소개로 이해해야 하며, 제공된 내용만으로 Firecrawl 자체의 환각 감소 효과가 별도로 입증됐다고 단정할 수는 없다.

🧾 핵심 주장 / 시사점

  • SimpleQA에서 정답률 차이는 작아도 오류율과 응답 보류율의 차이는 크므로, 모델 선택에서 정답률 하나만 보면 불확실성을 처리하는 방식의 차이를 놓칠 수 있다.
  • 실시간 검색의 가치는 최신 정보를 얻는 데 그치지 않고 작화를 대신할 근거를 제공하는 데 있지만, 근거가 없을 때 응답을 보류해야 그 효과가 이어진다.
  • 모델 규모 확대와 검색 연결만으로 신뢰성이 보장되지는 않으며, 저빈도 사실을 뒷받침할 권위 있는 출처와 질문에 적합한 문맥이 핵심 조건으로 제시된다.

✅ 액션 아이템

  • SimpleQA의 gpt-5-thinking-mini와 o4-mini 비교를 바탕으로 정답률·오류율·응답 보류율을 함께 검토.
  • 오래된 데이터 환각과 작화를 구분해 실시간 웹 검색과 근거 부재 시 응답 보류의 적용 필요성을 검토.
  • Firecrawl의 /search 활용 시 출처의 권위성·최신성, 질문 적합성, 토큰 효율적인 문맥 구성의 충족 여부를 확인.

❓ 열린 질문

  • SimpleQA·FRAMES의 정확도 25~40%포인트 개선은 어떤 기준 모델과 실험 조건에서 관찰됐는가?
  • 실시간 웹 검색에서 출처의 권위성·최신성과 질문 적합성을 어떤 기준으로 판단할 것인가?
  • 작화를 줄이기 위한 근거 부재 시 응답 보류는 어떤 조건에서 적용할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.