Pulse 게시 ·

ThinkingBox 공개, 에이전트의 실제 데이터 변경·반복 성공률 평가

Microsoft·Hugging Face가 10월 3일 AI 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20회 실행해 최종 데이터 상태와 부수 효과를 검사한다. 연구팀 평가에서 Claude Opus 5.5의 시도별 성공률은 67.16%였지만, 20회 모두 성공한 업무 비율은 47.53%였다.

소매·자동차보험·여행·네오뱅크·컨설팅 업무를 재구성한 합성 데이터이며 실제 고객 사례는 아니다.

각 시도는 같은 초기 상태의 독립 MCP 세션에서 실행한다. 477개 업무는 데이터 상태만 평가하고, 30개는 응답 평가도 추가한다.

시도별 성공률, 20회 중 한 번이라도 성공한 업무 비율, 실제 20회 모두 성공한 업무 비율을 구분해 제공한다.

OpenEnv 인터페이스로 실행하며 Linux·WSL, Python 3.11 이상, uv·Docker와 모델 엔드포인트가 필요하다.

ThinkingBox 코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스로 공개됐다.

환불·예약처럼 기록을 바꾸는 에이전트는 완료 응답뿐 아니라 실제 저장값을 검사하는 평가에 활용할 수 있다.

원문