ProvenanceGuard, MCP 에이전트 답변의 사실·출처 연결 검사
Multiverse Computing 연구팀이 9월 29일 MCP 에이전트 답변의 사실뿐 아니라 인용 출처까지 검사하는 ProvenanceGuard를 소개했다. 연구진에 따르면 의료 에이전트의 평가용 답변 40개에서 차단 대상 주장 139개 중 138개를 잡았지만, 근거가 있는 주장 67개도 보류했다.
에이전트를 재학습하지 않고 생성된 답변과 MCP 실행 기록을 읽어 주장 분리, 출처 선택, 근거 검사, 출처 일치 확인을 수행한다.
보고된 실험은 로컬 모델 구성이다. MiniLM으로 출처를 찾고 DeBERTa NLI로 근거를 검사하며, 답변당 추가 처리 시간은 약 0.5초였다.
유사한 출처가 여러 개 있는 별도 평가에서는 차단 판단 F1이 0.846이었지만, 정확한 출처 선택률은 50.3%였다.
전체 실행 기록의 수정 실험에서 차단된 답변 173개를 처리했으나, 144개는 실질적인 수정 답변 대신 대체 안내문으로 끝났다.
여러 도구를 쓰는 에이전트는 도구 출력과 출처 ID를 함께 남겨야 답변이 엉뚱한 자료를 인용했는지 추적할 수 있다.
원문
- Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP AgentsHugging Face · 원문 2026-09-29