ThinkingBox 공개, AI 에이전트의 작업 결과를 DB 상태로 평가
Microsoft와 Hugging Face가 10월 3일 AI 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20회 실행해 최종 DB 상태와 부수 효과를 검사한다. 연구진 평가에서 Claude Opus 5.5의 시도별 성공률은 67.16%였지만, 20회 모두 성공한 업무 비율은 47.53%였다.
소매·자동차보험·여행·네오뱅크·컨설팅 업무를 재구성한 합성 벤치마크이며, 실제 고객 데이터는 아니다.
매 시도는 동일한 초기 상태의 격리된 MCP 세션에서 실행된다. 477개 업무는 상태만 검사하고, 30개는 응답 평가도 추가한다.
Kimi-K3는 업무의 93.89%를 20회 중 한 번 이상 해결했지만, 20회 모두 성공한 업무는 13.41%였다.
코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0으로 공개됐다. OpenEnv 연동 평가에는 Python 3.11 이상, Docker와 모델 엔드포인트 등이 필요하다.
업무 완료 메시지 대신 실제 레코드 변경을 검사하므로, 정상 종료 뒤에도 남는 잘못된 상태를 평가에 잡아낼 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04