ThinkingBox 공개, 에이전트의 실제 데이터 변경과 반복 성공률 평가
Microsoft와 Hugging Face가 10월 3일 업무 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20회 실행하며 최종 데이터 상태와 부수 효과를 검사한다. Claude Opus 5.5의 시도별 성공률은 67.16%였지만, 20회 모두 성공한 업무는 47.53%였다.
소매·자동차보험·여행·네오뱅크·컨설팅 업무를 모사하며, 실제 고객 데이터가 아닌 합성 시나리오를 사용한다.
각 시도는 동일한 초기 상태의 격리된 MCP 세션에서 실행하며, 잘못된 값·누락된 변경·불필요한 변경을 검사한다.
507개 중 477개는 상태만으로 채점하고, 30개는 응답 내용 평가를 추가한다.
코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스다. OpenEnv 연동 실행에는 Python 3.11 이상·uv·Docker와 모델 엔드포인트 등이 필요하다.
업무 완료 판정을 에이전트의 답변 대신 실제 레코드 상태에 연결하는 평가를 자체 시스템에도 적용할 수 있다.
원문
- The Agent Said It Was Done. The Database Disagreed.Hugging Face · 원문 2026-10-04