ThinkingBox 공개, 에이전트의 DB 변경 결과와 반복 성공률 평가
Microsoft·Hugging Face가 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507종을 각각 20회 실행해 최종 DB 상태와 부수 효과를 검사한다. 평가에서 Claude Opus 5.5는 241개, GPT-6 Astra는 231개 업무를 20회 모두 성공했으며, OpenEnv로 직접 평가할 수 있다.
소매·자동차보험·여행·네오뱅크·컨설팅 업무를 모사하며, 매 시도는 같은 초기 상태의 격리된 MCP 세션에서 실행한다.
507개 중 477개 업무는 상태만 평가하고, 30개는 응답 내용 평가도 추가한다.
Kimi-K3는 476개 업무를 20회 중 한 번 이상 성공했지만, 20회 모두 성공한 업무는 68개였다.
ThinkingBox 코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스로 제공한다.
실행에는 Linux 또는 WSL, Python 3.11 이상, uv·Docker와 모델 엔드포인트 등이 필요하다.
업무 완료라는 답변 대신 실제 티켓 상태·환불 기록을 검사하는 방식으로 사내 에이전트 평가를 설계할 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04