ThinkingBox 공개, 에이전트 작업을 최종 DB 상태·20회 반복으로 평가
Microsoft와 Hugging Face는 10월 3일 ThinkingBox 평가 환경과 데이터셋 공개를 소개했다. 합성 업무 507개를 각각 20회 실행해 최종 DB 상태와 부수 변경을 검사한다. 연구팀 평가에서 Opus 5.5는 평균 성공률 67.16%였지만, 20회 모두 성공한 업무는 47.53%였다.
ThinkingBox는 격리된 MCP 세션에서 에이전트를 실행하는 환경이며, ThinkingBox-Bench는 소매·자동차보험·여행·네오뱅크·컨설팅의 합성 업무 데이터셋이다.
각 반복은 동일한 초기 상태에서 시작한다. 전체 507개 중 477개는 상태만으로 채점하고, 30개는 응답 내용 평가도 추가한다.
Kimi-K3는 20회 중 한 번 이상 성공한 업무가 93.89%였지만, 20회 모두 성공한 업무는 13.41%였다. 한 번의 해결 가능성과 반복 일관성이 갈렸다.
OpenEnv 인터페이스로 실행할 수 있으며 Linux·WSL, Python 3.11 이상, uv·Docker에서 시험됐다.
프레임워크 코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스다.
환불·예약 에이전트의 평가에 최종 레코드 검사를 넣으면, 도구 호출이 정상 종료돼도 잘못 처리된 업무를 잡아낼 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04