Articlehuggingface.co·2026년 9월 29일·0

Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents

Quick Summary

ProvenanceGuard는 MCP 에이전트의 주장이 사실인지뿐 아니라 답변이 명시하거나 암시한 출처에서 뒷받침되는지 검증하며, 높은 차단 성능과 함께 유사 출처 구분 및 보수적 차단의 한계를 보여준다.

Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents 관련 대표 이미지

🖼️ 인포그래픽

Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents의 핵심 내용을 4단계로 요약한 인포그래픽
Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP Agents 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

ProvenanceGuard는 MCP 에이전트의 주장이 사실인지뿐 아니라 답변이 명시하거나 암시한 출처에서 뒷받침되는지 검증하며, 높은 차단 성능과 함께 유사 출처 구분 및 보수적 차단의 한계를 보여준다.

📌 핵심 요약

  • ProvenanceGuard는 여러 도구의 근거를 합치면 놓칠 수 있는 교차 출처 혼동을 겨냥한다. 블랙박스 MCP 에이전트의 답변 생성 후 도구 출력과 source ID를 보존한 기록을 읽어 주장 분해, 출처 선택, 근거 지지 확인, 출처 귀속 비교를 수행하고, 주장별 판정과 답변 전체의 허용·차단 결정을 출력한다.
  • 의료 에이전트의 실제 기록 281개를 확보했고, 개발 데이터와 분리한 답변 40개의 주장 361개를 전문가가 평가했다. ProvenanceGuard는 차단 대상 주장 139개 중 138개를 잡고 1개를 통과시켰으며, 전문가가 지지된다고 본 주장 67개도 보류했다. 출처를 식별할 수 있는 주장에서는 약 86%의 출처 선택 정확도를 보였다.
  • 동일한 평가 주장 묶음에서 차단 F1은 ProvenanceGuard 0.802, MiniCheck 0.783, RAGAS Faithfulness 0.758, AlignScore 0.662, SummaC-ZS 0.436이었다. 유사 출처가 여러 개 있는 별도 시험에서는 차단 F1이 0.846이었지만 정확한 출처 식별률은 50.3%였고, 명시된 출처만 바꾼 통제 시험에서는 50건 모두를 탐지했다.
  • RARR 방식의 수정 루프는 전체 기록 실행에서 차단된 답변 173개를 모두 처리했지만, 144개는 실질적인 재작성 대신 대체 문구로 끝났다. 재구성한 다중 출처 시험 기록의 새 실행에서는 처음 차단된 답변 59개를 모두 처리했고 최종 대체 문구는 2개였다. 보고된 로컬 구성의 오프라인 검증 추가 시간은 답변당 약 0.5초였다.
  • 실험은 로컬 언어 모델, 출처 선택용 MiniLM, 근거 확인용 DeBERTa NLI 모델을 사용했다. 이 모델들은 필수 요건이 아니며 호스팅 모델로 바꾸면 별도 시험과 보정이 필요하다. 다른 분야에 적용하려면 도구 출력과 source ID가 보존되어야 하며, NVIDIA NVFlow의 금융 에이전트에는 검색된 SEC 발췌문으로 완성된 답변을 확인하는 선택적 검증 단계가 병합되었다.

🧩 주요 포인트

  1. 여러 도구의 근거에 사실이 존재해도 출처 귀속은 틀릴 수 있음 → MCP 에이전트의 사실성 판단에 주장과 source ID의 연결 및 명시·암시된 출처와의 일치 여부가 포함되어야 한다.
  2. 차단 대상 139개 중 138개 탐지와 지지된 주장 67개 보류가 함께 발생 → 보수적 검증은 누락을 줄이는 대신 추가 검토·수정 부담을 만들며, 유사 출처 식별률 50.3%는 출처 선택의 별도 한계를 드러낸다.
  3. 로컬 구성과 NVIDIA NVFlow 적용이 검증 계층의 확장 가능성을 보여줌 → 도구 출력과 source ID 보존, 구성별 시험·보정이 적용 조건이며, 수정 결과는 실질적인 재작성과 대체 문구를 구분해 해석해야 한다.

🧠 상세 정리

1. MCP 환경에서 달라지는 사실성 검증

MCP를 사용하는 LLM 에이전트는 하나의 검색 문단만 읽는 대신 검색 도구, 구조화된 환자·계정 기록, 데이터베이스, 메타데이터 등 여러 입력을 결합해 답변한다. 원문은 이런 환경에서 사실성 검증이 단순히 근거 전체에 주장이 존재하는지를 확인하는 것보다 복잡해진다고 설명한다. RAGAS Faithfulness와 MiniCheck, AlignScore, SummaC 같은 검증기는 일반적인 사용 형태에서 모아 놓은 근거가 주장을 지지하는지 판단하지만, 각 주장을 뒷받침하는 MCP 도구 출력과 답변이 지목한 출처의 일치 여부까지 알려주지는 않는다. 논문 「ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents」는 이 간극을 다룬다. 핵심 문제인 교차 출처 혼동은 근거 어딘가에서는 참인 주장이 다른 출처에서 나온 것처럼 제시되는 오류로, 출처를 구분하지 않는 검증기는 이를 통과시킬 수 있다.

2. 사실의 지지와 출처 귀속은 별개의 문제

고객 지원 사례에서 에이전트가 계정 기록에 따르면 해당 요금제에 30일 환불 기간이 있다고 답해도, 실제로 그 조건을 담은 자료는 계정 기록이 아니라 정책 문서일 수 있다. 두 자료를 합치면 환불 기간이라는 사실은 확인되지만, 출처를 나누어 보면 답변의 귀속은 잘못되어 있다. 임상 에이전트에서도 환자 이력 도구에서 얻은 개인별 약물 정보를 의학 문헌의 연구 결과처럼 제시하면 같은 문제가 발생한다. 원문은 데이터에 민감한 환경에서 잘못된 출처 귀속이 잘못된 사실만큼 해로울 수 있다고 주장한다. 출처는 계정 기록을 직접 언급하는 방식으로 명시되기도 하고 답변의 표현에 암시되기도 하므로, ProvenanceGuard는 주장과 출처의 연결을 검토할 수 있도록 유지한다. 글 아래 저자 답변 역시 다른 도구 출력에서 사실을 찾는 것만으로는 부족하며, 답변이 명시하거나 암시한 출처가 주장을 지지해야 한다고 재확인한다.

3. 주장부터 답변 전체까지 이어지는 검증 흐름

ProvenanceGuard는 블랙박스 MCP 에이전트 위에 놓이는 생성 후 검증 계층으로, 에이전트를 재학습하지 않고 완성된 답변을 검사한다. 입력으로는 도구 출력과 source ID를 포함하는 수집된 MCP 실행 기록을 읽으며, 근거를 출처 없는 하나의 문맥으로 합치지 않는다. 먼저 답변을 구체적인 주장으로 분해하고 각 주장에 가장 관련 있는 출처를 찾은 뒤, 해당 출처가 실제로 주장을 뒷받침하는지 확인한다. 이어서 확인한 출처를 답변이 명시하거나 암시한 출처와 비교하고, 주장별 출처 판정과 답변 전체의 허용 또는 차단 결정을 출력한다. 출처 정체성을 분해, 라우팅, 근거 점수 산정, 귀속 검사, 수정 과정까지 보존하는 것이 이 흐름의 중심이다. 차단된 답변에는 RARR 방식의 수정을 적용할 수 있으며, 수정된 답변도 검증기를 다시 거쳐야 한다.

4. 로컬 모델 구성과 보수적 판정의 조건

논문 실험에서는 수집된 기록을 통제된 오프라인 환경에서 처리하기 위해 로컬 모델을 사용했다. MiniLM은 관련 출처를 찾는 데 쓰이고, DeBERTa NLI 검증 모델은 해당 출처가 주장을 지지하는지 확인하며, 로컬 언어 모델은 답변을 주장으로 나누는 작업을 돕는다. 검증기는 숫자, 날짜, 식별자 같은 문자 그대로의 값도 면밀히 확인하므로, 출처에 없는 값이 문장상 그럴듯하다는 이유만으로 통과하지는 않는다. 보정된 결정 단계가 이러한 신호를 결합하고, 차단된 답변은 출처에 근거한 수정이나 안전한 대체 문구를 시도한 뒤 재검증한다. 다만 명시된 모델들은 평가에 사용된 구성일 뿐 ProvenanceGuard의 필수 요건은 아니며, 호스팅 모델로 같은 절차를 구현하려면 새로운 구성에 맞는 시험과 보정이 필요하다. 보고된 결과는 로컬 구성에서 나온 것으로, 원문은 빠른 답변보다 올바른 출처를 중시하는 민감 데이터 검토에 이 보수적 정책이 적합하다고 설명한다.

5. 의료 평가 결과와 기존 검증기 비교

연구진은 환자 기록, 연구 논문 및 다른 도구를 사용한 의료 에이전트에서 실제 실행 기록 281개를 확보했고, 개발에 사용한 데이터와 분리한 답변 40개의 주장 361개를 전문가가 확인하도록 했다. 전문가가 통과시키면 안 된다고 판단한 주장 139개 중 ProvenanceGuard는 138개를 잡아냈고 1개를 통과시켰으며, 전문가가 지지된다고 본 주장 67개도 검토나 수정을 위해 보류했다. 이는 일부 지지된 주장에 재검토를 요구하더라도 지지되지 않는 주장의 통과를 줄이는 평가 설정의 보수성을 보여준다. 출처를 식별할 수 있는 주장에서는 약 86%의 확률로 올바른 출처를 선택했다. 동일한 평가 주장 묶음의 차단 F1은 ProvenanceGuard 0.802, MiniCheck 0.783, RAGAS Faithfulness 0.758, AlignScore 0.662, SummaC-ZS 0.436으로 보고되었다. 비교 대상 검증기들은 주장별 지원 도구 출력을 알려주지 않았지만, ProvenanceGuard는 주장과 source ID의 연결을 기록해 검토자가 확인한 출처와 판정을 볼 수 있게 했다.

6. 유사 출처 구분의 한계와 귀속 변경 시험

여러 출처가 서로 비슷한 별도의 어려운 시험에서 ProvenanceGuard는 차단 여부 판정 F1 0.846을 기록했지만, 정확한 출처를 식별한 비율은 50.3%에 그쳤다. 원문은 이를 비슷한 출처들을 구별하는 능력이 여전히 중요한 개선 과제임을 보여주는 결과로 제시한다. 이 결과는 차단 성능이 높더라도 어느 출처가 정확히 근거인지 선택하는 성능까지 같은 수준으로 확보되는 것은 아님을 드러낸다. 연구진은 잘못된 귀속만을 겨냥한 통제 시험도 진행해, 지지 근거를 그대로 둔 채 답변에 명시된 출처를 50건에서 바꾸었다. ProvenanceGuard는 이 출처 교체 50건을 모두 탐지했으며, 원문은 이를 명확한 출처 오류를 잡을 수 있다는 증거로 설명한다. 다만 여러 그럴듯한 출처 중 하나를 골라야 하는 어려운 시험의 결과도 함께 제시하므로, 통제 시험의 성공을 모든 다중 출처 상황에서의 정확한 귀속 보장으로 확대하지 않는다.

7. 차단된 답변의 수정과 처리 비용

원문은 답변 차단이 유용하려면 차단 이후 처리 방법도 있어야 한다고 보고, ProvenanceGuard를 RARR 방식의 수정 루프에 연결한 결과를 제시한다. 전체 실행 기록을 대상으로 한 실행에서는 차단된 답변 173개를 모두 처리했지만, 그중 144개는 실질적인 재작성 대신 대체 문구로 끝났다. 원문은 이 결과를 시스템이 검증할 수 없는 답변을 만들어내기보다 피하는 선택으로 설명하므로, 모든 차단 해소를 내용 있는 답변의 복구로 해석해서는 안 된다. 재구성한 다중 출처 시험 기록에서 새로 수행한 수정 실행은 처음 차단된 답변 59개를 모두 처리했고, 최종 대체 문구는 2개였다. 두 실행의 결과는 서로 다른 기록 조건에서 제시되며, 원문은 후자의 낮은 대체 문구 수를 보고하되 그 차이의 원인을 여기서 확정하지 않는다. 보고된 로컬 구성에서 오프라인 검증의 추가 시간은 답변당 약 0.5초였고, NLI와 라우팅 호출 자체는 수십 밀리초 수준이었다.

8. 다른 분야 적용과 NVIDIA NVFlow 사례

원문은 단일 문단 RAG에서 여러 도구를 사용하는 MCP로 이동할수록 사실이 어느 출처에서 왔는지가 사실성 판단의 일부가 된다고 주장한다. Multiverse Computing에는 필요할 때 민감한 실행 기록을 통제된 환경에 유지하면서 기존 에이전트를 확인할 수 있는 방법이라는 의미가 있다. 의료 연구는 하나의 사용 사례이며, 에이전트 기록이 도구 출력과 출처를 보존한다면 다른 분야로도 같은 접근을 적용할 수 있다고 설명한다. NVIDIA NVFlow에는 금융 에이전트의 선택적 근거 검증 단계가 병합되었으며, 에이전트가 검색한 SEC 발췌문을 기준으로 완성된 답변을 검사하고 원래 롤아웃이나 학습 데이터를 바꾸지 않은 채 별도의 판정을 저장한다. 이 기여는 ProvenanceGuard의 출처 인식 검증 접근을 사용하지만, 앞서 설명한 수정 루프는 더 넓은 연구 시스템에 속한다. ProvenanceGuard는 UC Berkeley의 Agentic AI Summit 2026에서 포스터로도 발표되었고, 원문은 라우팅·NLI 도출, 보정 절제 실험, 다중 출처 스트레스 평가와 전체 결과표를 확인할 자료로 Hugging Face와 arXiv의 논문을 안내한다.

🧾 핵심 주장 / 시사점

  • MCP 환경의 사실성에는 내용의 지지뿐 아니라 출처 귀속의 정확성도 포함된다. 여러 도구의 근거를 합친 점수만으로는 참인 사실을 잘못된 출처에 연결한 오류가 드러나지 않을 수 있다.
  • 차단 성능, 정확한 출처 선택, 차단 후 실질적인 답변 복구는 구분해 해석해야 한다. 유사 출처 시험의 식별률 50.3%와 전체 기록 수정 실행의 대체 문구 144개는 높은 탐지 성능만으로 설명되지 않는 한계를 보여준다.
  • 로컬 처리와 호스팅 모델 적용은 선택 가능한 구성인 반면, 주장과 출처의 연결을 유지하는 실행 기록은 적용의 핵심 조건이다. 보고된 로컬 성능을 다른 구성에 적용하려면 별도 시험과 보정이 필요하다.

✅ 액션 아이템

  • MCP 에이전트 검증에서 주장별 source ID와 답변이 명시하거나 암시한 출처의 일치 여부를 함께 확인한다.
  • 유사 출처 식별률 50.3%와 지지된 주장 67개 보류를 고려해, 출처 선택의 정확성과 추가 검토·수정 부담을 함께 평가한다.
  • 호스팅 모델 적용 시 별도 시험과 보정을 수행하고, RARR 방식의 수정 결과는 실질적인 재작성과 대체 문구로 구분해 해석한다.

❓ 열린 질문

  • 적용 대상 MCP 에이전트의 실행 기록은 주장별 출처 검증에 필요한 도구 출력과 source ID를 보존하는가?
  • 유사 출처 식별률 50.3%와 지지된 주장 67개 보류를 적용 환경에서는 어느 수준까지 수용할 수 있는가?
  • 호스팅 모델로 변경하면 별도 시험과 보정에서 차단 성능, 출처 선택 정확도, 답변당 약 0.5초의 추가 시간은 어떻게 달라지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.