마이크로소프트와 허깅페이스가 공동 개발한 AI 에이전트 평가 벤치마크 'ThinkingBox'는 에이전트가 생성한 문장이나 도구 호출이 아니라 실제로 데이터베이스에 남긴 최종 상태와 부작용을 기준으로 평가한다. 507개의 상태 기반 업무 워크플로를 12개 LLM 모델에 각각 20회씩 반복 실행한 결과, 12만1680건의 유효 시도 중 7만9853건이 실행 가능성 검사에 실패했고 이 중 67.24%는 도구 오류 없이 정상 종료된 것처럼 보였지만 77.61%는 잘못된 필드 값을, 43.30%는 의도치 않은 부작용을 보였다. 단일 시도 성공률(pass@1)에서는 Claude Opus 5.5가 67.16%로 1위였지만, 20회 모두 성공(20/20)한 과제 수는 Opus 5.5와 Opus 5가 동일하게 241개로 나타나 정확도 향상이 반드시 신뢰성 향상으로 이어지지 않음을 보였다. 실패의 약 80%는 추론이 아니라 도구 처리 오류에서 발생해, 실제 배포 시에는 모델의 응답이 아니라 최종 데이터베이스 상태를 직접 확인하는 검증 체계가 필요하다는 점을 시사한다.
- •MS·허깅페이스, 에이전트의 응답이 아닌 데이터베이스 최종 상태·부작용으로 평가하는 'ThinkingBox' 벤치마크 공개
- •507개 업무 과제를 12개 LLM에 각 20회씩 실행, 12만1680건 중 7만9853건 실행 검사 실패
- •실패 중 67.24%는 도구 오류 없이 정상 종료됐으나 77.61%는 필드 값 오류, 43.3%는 의도치 않은 부작용 발생
- •pass@1 1위는 Claude Opus 5.5(67.16%)지만 20/20 완전 성공 과제 수는 Opus 5.5·Opus 5 동일(241개)
- •실패의 약 80%는 추론이 아닌 도구 처리(tool usage) 문제, 허깅페이스에서 하니스·데이터셋 공개
0단 자동
AI가 규칙대로 쓰고 그대로 게시했습니다. 사람이 따로 보지 않았습니다.
- 규칙 판
- 규칙 판 도입 이전 기사입니다.
- 남기는 것
- 규칙 판 · 모델 · 시각
- 판 기록
- 아직 없습니다.
The Agent Said It Was Done. The Database Disagreed.

- 1.MS·허깅페이스의 ThinkingBox-Bench, 507개 업무 워크플로를 20회씩 실행해 DB 최종상태로 채점
- 2.12개 LLM 12만1680회 시도 중 79853건 실패, 이 중 67.24%는 겉으론 정상 종료·툴 오류 없음
- 3.Claude Opus 5.5가 pass@1 67.16%로 1위, 20/20 완전성공 과제는 Opus5.5·Opus5 공동 241개
- 4.실패원인 79.9%는 툴 처리 문제, dependable task당 비용은 GPT-5.4가 6.80달러로 최저
왜 중요한가?
에이전트가 '답변은 맞게 말했지만 DB 상태는 틀린' 실패를 최종 응답이나 툴 호출 성공만으로는 잡아내지 못한다는 것을 대규모로 입증해, 실제 레코드를 다루는 에이전트 평가 기준을 '텍스트 정답'에서 '백엔드 상태 일치'로 옮겨야 한다는 근거를 제공한다.
전체 내용이 궁금하다면?
원문을 직접 읽어보세요
이 글이 만들어진 과정
- 10:39AI 초안

