Pulse 게시 ·

ThinkingBox, 에이전트의 최종 데이터 상태·20회 반복 성공 평가

Microsoft와 Hugging Face가 10월 3일 업무용 AI 에이전트 평가 환경 ThinkingBox를 공개했다. 합성 업무 507개를 각각 20회 실행해 최종 데이터 상태와 부수 효과를 검사한다. 모든 반복에 성공한 과제 비율은 Claude Opus 5·5.5가 47.53%, GPT-6 Astra가 45.56%였다.

소매·자동차보험·여행·네오뱅크·컨설팅의 업무 흐름을 평가하며, 각 시도는 동일한 초기 상태의 격리된 MCP 세션에서 실행한다.

507개 과제 중 477개는 데이터 상태만 검사하고, 30개는 응답 내용 평가도 추가한다. 고객과 업무는 실제 사례를 본뜬 합성 데이터다.

Kimi-K3는 20회 중 한 번 이상 성공한 과제가 93.89%였지만, 20회 모두 성공한 과제는 13.41%였다.

OpenEnv 인터페이스로 실행할 수 있다. Linux·WSL, Python 3.11 이상, uv·Docker와 에이전트·모의 사용자·평가자용 모델 엔드포인트가 필요하다.

코드는 MIT, 벤치마크 데이터는 CDLA-Permissive-2.0 라이선스로 공개됐다.

업무 완료 답변 뒤 실제 티켓 상태나 환불 기록을 검사하는 절차를 에이전트 평가에 넣을 수 있다.

원문