Pulse 게시 ·

ProvenanceGuard, MCP 에이전트 답변의 사실·출처 연결 검사

Multiverse Computing 연구진이 9월 29일 MCP 에이전트용 검증 방식 ProvenanceGuard를 소개했다. 도구 출력별 출처를 유지해 답변의 주장과 인용 출처가 일치하는지 검사한다. 의료 에이전트 답변 40개의 주장 361개 평가에서 차단 대상 139개 중 138개를 잡았지만, 근거가 있는 주장 67개도 보류했다.

기존 에이전트를 재학습하지 않고 MCP 실행 기록을 읽어 주장 분해·출처 선택·근거 검사·출처 일치 판정을 수행한다.

보고된 로컬 구성은 MiniLM으로 출처를 찾고 DeBERTa NLI 모델로 근거를 검사한다. 다른 구성에는 별도 시험과 보정이 필요하다.

출처를 식별할 수 있는 주장에서는 약 86%의 출처 선택 정확도를 보였지만, 유사한 출처가 여러 개인 별도 시험에서는 50.3%로 낮아졌다.

전체 실행 기록의 수정 과정에서 차단 답변 173개 중 144개는 실질적인 재작성 대신 대체 문구로 끝났다.

보고된 로컬 구성의 처리 부담은 답변당 약 0.5초이며, 저렴한 LLM 판정기와의 직접 비교는 제시하지 않았다.

여러 도구를 쓰는 에이전트의 검증에는 출력 내용과 함께 출처 ID를 기록해야 한다. 자료 전체에 사실이 존재해도 답변이 엉뚱한 기록을 근거로 지목할 수 있기 때문이다.

원문