Microsoft·Hugging Face, DB 최종 상태로 에이전트 평가하는 ThinkingBox 공개
Microsoft·Hugging Face가 10월 3일 업무 처리 후 DB 상태와 부수 효과를 검사하는 ThinkingBox 평가 환경을 소개했다. 실제 업무를 재구성한 합성 과제 507개를 각각 20회 실행했다. 연구진에 따르면 Kimi-K3는 93.89%의 과제를 한 번 이상 성공했지만, 20회 모두 성공한 과제는 13.41%였다.
Claude Opus 5.5의 단일 시도 성공률은 67.16%, 20회 모두 성공한 과제 비율은 47.53%였다. GPT-6 Astra의 20회 전부 성공 비율은 45.56%였다.
507개 중 477개 과제는 상태만으로 채점하며, 30개는 응답 내용에 대한 평가를 추가한다. 각 실행은 초기화된 독립 MCP 세션을 사용한다.
12개 모델의 유효 실행 12만1680건을 분석한 실험에서 실패한 시도의 67.24%는 정상 종료하고 상태 변경 도구를 호출했으며 마지막 도구 오류도 없었다.
OpenEnv 인터페이스로 실행할 수 있다. Linux·WSL, Python 3.11 이상, uv·Docker와 모델 엔드포인트가 필요하다.
코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스로 제공한다.
업무 에이전트 평가에 완료 응답뿐 아니라 실제 레코드 변경과 반복 성공률을 함께 넣는 데 활용할 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04