ThinkingBox 공개…에이전트가 남긴 데이터 상태와 반복 성공률 평가
Microsoft와 Hugging Face가 10월 3일 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20회 실행해 최종 데이터 상태와 부수적 변경을 검사한다. Claude Opus 5.5의 시도별 성공률은 67.16%였지만, 20회 모두 성공한 과제는 47.53%였다.
소매·자동차보험·여행·네오뱅크·컨설팅 업무를 평가하며, 모든 과제는 실제 고객 자료가 아닌 합성 시나리오다.
각 시도는 동일한 초기 상태의 독립된 MCP 세션에서 실행된다. 477개 과제는 데이터 상태만 평가하고, 30개는 응답 평가도 추가한다.
Kimi-K3는 507개 중 476개를 한 번 이상 해결했지만, 20회 모두 성공한 과제는 68개였다. Claude Opus 5와 5.5는 각각 241개였다.
12개 모델의 공통 과제 분석에서 실패 시도의 67.24%는 상태 변경 도구를 호출하고 최종 도구 오류 없이 종료했는데도 검사에 실패했다.
OpenEnv 인터페이스로 실행할 수 있다. Linux·WSL, Python 3.11 이상, uv·Docker와 에이전트·모의 사용자·평가자용 모델 엔드포인트가 필요하다.
코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스로 공개됐다.
업무 에이전트의 완료 판정에 실제 레코드 검사를 넣으면, 도구 호출이 정상 종료돼도 상태를 잘못 바꾼 실패를 잡을 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04