ProvenanceGuard, MCP 에이전트 답변의 사실과 출처를 함께 검사
Multiverse Computing이 9월 29일 MCP 에이전트 답변의 주장과 인용 출처를 대조하는 ProvenanceGuard 연구를 소개했다. 의료 에이전트 답변 40개의 주장 361개를 평가해 차단 대상 139개 중 138개를 잡았지만, 타당한 주장 67개도 보류했다. 유사 출처가 많은 별도 시험의 정확한 출처 식별률은 50.3%였다.
에이전트 재학습 없이 생성 후 MCP 실행 기록을 읽고, 주장 분해·출처 선택·내용 지원 여부·출처 귀속을 검사한다.
평가한 로컬 구성은 MiniLM으로 출처를 찾고 DeBERTa NLI로 주장을 검증하며, 로컬 언어 모델로 답변을 분해한다.
명시된 출처만 바꾼 통제 시험 50건에서는 출처 오류를 모두 감지했다.
전체 실행 기록의 차단 답변 173개를 후처리한 결과, 144개는 실질적인 수정 답변 대신 대체 문구로 종료됐다.
보고된 로컬 구성의 추가 처리 시간은 답변당 약 0.5초이며, 다른 모델 구성에는 별도 시험과 보정이 필요하다.
이를 적용하려면 도구 결과와 출처 ID를 함께 기록해야 한다. 여러 검색·데이터베이스 결과를 하나의 문맥으로 합치기 전에 출처 연결을 보존하는 설계가 필요하다.
원문
- Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP AgentsHugging Face · 원문 2026-09-29