ThinkingBox 공개, AI 에이전트의 실제 데이터 변경·반복 성공 평가
Microsoft와 Hugging Face가 10월 3일 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20번 실행해 최종 데이터 상태와 부수 효과를 검사한다. 연구진 평가에서 Kimi-K3는 93.89%의 업무를 한 번 이상 성공했지만, 20번 모두 성공한 업무는 13.41%였다.
각 시도는 동일한 초기 상태의 격리된 MCP 세션에서 실행된다. 507개 업무 중 477개는 데이터 상태만으로 판정하고, 30개는 응답 평가를 추가한다.
단일 시도 성공률, 20회 중 한 번 이상 성공한 업무 비율, 실제로 20회 모두 성공한 업무 비율을 별도로 보고한다.
Claude Opus 5.5의 단일 시도 성공률은 67.16%였으며, 20회 모두 성공한 업무는 241개로 47.53%였다.
벤치마크의 고객과 업무는 실제 기업 업무 패턴을 바탕으로 합성한 것으로, 실제 고객 기록은 아니다.
코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스다. OpenEnv 인터페이스를 통해 자체 모델을 평가할 수 있으며 Linux·WSL, Python 3.11 이상, uv·Docker에서 시험됐다.
환불·예약처럼 기록을 바꾸는 에이전트는 완료 답변보다 최종 필드 값과 불필요한 변경 여부를 검사하도록 평가를 설계할 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04