ProvenanceGuard, MCP 에이전트 답변의 사실·출처 연결을 함께 검사
Multiverse Computing 연구진이 9월 29일 MCP 에이전트의 답변과 도구별 출처를 대조하는 ProvenanceGuard를 소개했다. 연구진에 따르면 의료 에이전트 답변 평가에서 차단 대상 주장 139개 중 138개를 잡았지만, 근거 있는 주장 67개도 보류했다. 유사한 출처를 구분하는 별도 시험의 정확한 출처 식별률은 50.3%였다.
에이전트를 재학습하지 않고 생성 후 MCP 실행 기록을 읽어 주장 분해, 출처 선택, 근거 확인, 인용 출처 대조를 수행한다.
주 평가에서는 개발용 데이터와 분리한 답변 40개의 주장 361개를 전문가가 검토했다.
출처를 식별할 수 있는 주장에서는 약 86%의 출처 선택 정확도를 기록했지만, 여러 유사 출처를 둔 별도 시험에서는 50.3%였다.
근거를 유지한 채 명시된 출처만 바꾼 통제 시험에서는 50건 모두를 탐지했다.
전체 실행 기록의 차단 답변 173개를 처리한 복구 과정에서 144개는 실질적 재작성 대신 대체 문구로 끝났다.
보고된 결과는 로컬 모델 구성에서 얻었으며, 저렴한 출처 인식 LLM 평가자와의 직접 비교는 보고하지 않았다.
여러 도구를 쓰는 에이전트를 평가하려면 도구 출력과 출처 ID를 보존해야 답변이 엉뚱한 자료를 인용했는지도 추적할 수 있다.
원문
- Getting the Source Right, Not Just the Fact: Source-Aware Verification for MCP AgentsHugging Face · 원문 2026-09-29