Articlehuggingface.co·2026년 10월 3일·0

The Agent Said It Was Done. The Database Disagreed.

Quick Summary

Microsoft ThinkingBox는 507개 업무를 각각 20회 실행해 AI 에이전트가 남긴 실제 백엔드 상태와 부수 효과를 평가하며, 단일 성공률·반복 일관성·비용이 서로 다른 모델 선택 기준임을 보여준다.

The Agent Said It Was Done. The Database Disagreed. 관련 대표 이미지

🖼️ 인포그래픽

The Agent Said It Was Done. The Database Disagreed. 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

The Agent Said It Was Done. The Database Disagreed.의 핵심 내용을 4단계로 요약한 인포그래픽
The Agent Said It Was Done. The Database Disagreed. 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Microsoft ThinkingBox는 507개 업무를 각각 20회 실행해 AI 에이전트가 남긴 실제 백엔드 상태와 부수 효과를 평가하며, 단일 성공률·반복 일관성·비용이 서로 다른 모델 선택 기준임을 보여준다.

📌 핵심 요약

  • ThinkingBox는 응답 문장이나 유효한 도구 호출보다 최종 백엔드 상태를 성공 근거로 삼는다. 12개 모델의 유효한 시도 121,680건 중 79,853건이 실행 가능한 검증에 실패했으며, 실패 시도의 67.24%는 상태 변경 도구를 호출하고 최종 도구 오류 없이 정상 종료했다.
  • 507개 업무를 동일한 초기 상태에서 각각 20회 독립 실행하고, 전체 시도의 성공 비율인 pass@1, 20회 중 한 번 이상 성공한 업무 비율인 pass@20, 실제로 20회 모두 성공한 업무인 observed 20/20을 구분한다. Claude Opus 5.5의 전체 pass@1은 67.16%로 가장 높았다.
  • Kimi-K3는 476개 업무에서 한 번 이상 성공해 pass@20이 93.89%였지만, 20회 모두 성공한 업무는 68개로 13.41%였다. Claude Opus 5와 Claude Opus 5.5는 각각 241개 업무에서 20회 모두 성공해 47.53%를 기록했고, GPT-6 Astra는 231개로 45.56%였다.
  • 추정 단일 성공 시도당 비용은 GPT-5.6 Sol이 $0.127로 가장 낮았지만, 20회 모두 성공한 업무당 비용은 GPT-5.4가 $6.80, GPT-6 Astra가 $7.45, Claude Opus 5.5가 $7.80이었다. 비용은 OpenRouter의 할인 없는 정가로 계산한 비교 지표이며 실제 청구액이나 운영 요청당 가격은 아니다.
  • 실패 진단 비중의 모델별 비가중 평균은 도구 사용 79.9%, 잘못된 상태 갱신 10.3%, 불완전한 사용자 문제 해결 7.0%, 상태 변경 행동 부재 2.9%였다. 원문은 실패 약 5건 중 4건을 추론보다 도구 처리 문제로 분류하지만, 제공된 본문은 이 설명 도중 끝난다.

🧩 주요 포인트

  1. 정상 종료와 상태 변경이 실행 검증 통과를 보장하지 않음 → 에이전트 평가에 최종 필드값과 필수·불필요한 부수 효과 확인이 필요하다.
  2. Kimi-K3는 업무 범위에서 앞서고 Claude Opus 5 계열은 observed 20/20에서 앞섬 → 실제 기록을 변경하는 업무에서는 수행 가능 범위와 반복 일관성을 분리해 판단해야 한다.
  3. GPT-5.6 Sol의 단일 성공 비용 우위가 반복 일관성 비용 우위로 이어지지 않음 → GPT-5.4·GPT-6 Astra·Claude Opus 5.5의 비용과 20/20 업무 수를 함께 비교해야 한다.

🧠 상세 정리

1. 완료 선언과 실제 기록이 어긋난 고객 지원 사례

Microsoft와 Hugging Face의 공동 글은 $745짜리 주방 가전이 Nashville 물류센터에서 배송 예외 상태에 묶여 예상 배송일을 15일 넘긴 고객 사례로 시작한다. 에이전트는 주문과 배송 추적, 고객 프로필, 환불 정책, 기존 문의 유무 등을 확인하고 문의를 생성해 경과를 기록하는 등 아홉 번의 도구 호출을 수행했으며, 고객의 계정 등급이 배송 지연 보상 대상이 아니라는 정책도 정확히 읽었다. 그러나 배송 예외가 해결되지 않았는데도 문의를 resolved로 종료하고 문제가 해결됐다는 취지로 응답해, 고객이 실제로 물었던 내용에는 제대로 답하지 못했다. 요구된 최종 상태는 해결을 기다리는 on hold였으며, 실행 검증에서는 문의 상태 필드가 필요한 hold 대신 solved로 남은 것을 실패로 판정했다. 이 사례는 도구 호출 형식과 데이터베이스 쓰기가 모두 정상이어도 업무 결과는 틀릴 수 있음을 보여준다.

2. 도구 호출 대신 최종 백엔드 상태를 검증하는 이유

ThinkingBox는 격리된 MCP 도구 세션에서 에이전트를 실행하고, 마지막에 남은 백엔드 상태와 부수 효과를 실행 가능한 검증으로 평가한다. 최종 응답과 유효한 도구 호출은 결과의 대리 지표일 뿐이며, 올바르게 말하면서도 잘못된 필드값을 남기거나 다른 기록을 바꾸거나 불필요한 변경을 추가할 수 있다는 것이 글의 출발점이다. 12개 모델의 공통 평가 집합을 사용한 비교 실험에서는 유효한 시도 121,680건 중 79,853건이 검증에 실패했고, 그 실패 중 67.24%는 상태 변경 도구를 호출한 뒤 최종 도구 오류 없이 정상 종료했다. 실행 검증은 이들에서 잘못된 필드값 77.61%, 의도하지 않은 추가 효과 43.30%, 필요한 효과 누락 25.36%를 발견했으며, 이 범주들은 서로 겹친다. 따라서 실행 경로가 성공을 주장하더라도 실제 기록이 그 주장을 뒷받침하는지 별도로 확인해야 한다는 논리다.

3. 단일 성공률·수행 범위·반복 일관성을 분리하는 지표

ThinkingBox는 상태를 가진 업무 흐름 507개를 각각 동일하게 초기화된 백엔드에서 20회 독립 실행해, 한 번의 성공과 반복 가능한 성공을 구분한다. pass@1은 전체 시도 중 성공한 비율로 평소 수행 수준을 나타내고, pass@20은 20회 중 적어도 한 번 성공한 업무의 비율로 수행 가능한 업무 범위를 나타낸다. observed 20/20은 기록된 20회 실행을 모두 통과한 업무를 뜻하며, 이 글에서는 507개 중 해당 업무가 실제로 몇 개인지를 추정이나 평활화 없이 보고한다. 한 번 환불을 정확히 처리했어도 다음 네 번을 잘못 처리한다면 정상적인 환불 에이전트로 보기 어렵다는 예시가 반복 평가의 필요성을 설명한다. 이 구분을 통해 평균 성공률이 높다는 사실, 어떤 업무를 한 번 수행할 수 있다는 사실, 관측된 모든 반복에서 성공했다는 사실을 서로 다른 질문의 답으로 읽게 한다.

4. 전체 성능 순위와 도메인별 차이

평가 업무는 소매 98개, 자동차 보험 100개, 여행 104개, 네오뱅크 104개, 컨설팅 101개로 구성되며, 전체 pass@1은 업무 수에 따른 가중 결과다. 독점 모델에서는 Claude Opus 5.5가 67.16%로 선두였고, Claude Opus 5가 66.50%, GPT-5.4가 65.36%, GPT-5.6 Sol이 61.91%, Claude Sonnet 4.6이 59.19%, GPT-6 Astra가 58.31%를 기록했다. 공개 가중치 모델에서는 Kimi-K3가 57.37%로 가장 높아 GPT-6 Astra와 1%포인트 이내 차이를 보였으며, Qwen3.8-27B는 51.70%, DeepSeek-V4-Pro는 43.26%였다. 도메인 차이도 커서 Claude Opus 4.6은 소매에서 68.62%였지만 자동차 보험에서는 8.30%였고, Kimi-K3는 소매에서 82.24%로 모든 독점 모델보다 높았다. 따라서 전체 순위만으로 특정 업무에 대한 적합성을 판단하기 어렵고, 원문은 단일 시도 점수가 20회 반복에서도 얼마나 유지되는지 이어서 살핀다.

5. 넓은 수행 범위가 높은 일관성을 뜻하지는 않는다

Kimi-K3는 507개 중 476개 업무에서 한 번 이상 성공해 pass@20이 93.89%였고, 모든 시도에서 실패한 업무는 31개로 평가 모델 중 가장 적었다. 하지만 20회 모두 성공한 업무는 68개, 13.41%에 그쳐 넓은 수행 범위와 반복 일관성 사이의 차이가 크게 드러났다. Claude Opus 5는 한 번 이상 성공한 업무 비율이 79.09%이고 106개 업무에서는 한 번도 성공하지 못했지만, 241개 업무에서는 20회 모두 성공해 47.53%를 기록했다. Claude Opus 5.5는 pass@1과 한 번 이상 성공한 업무 수가 개선됐어도 20/20 업무 수는 Claude Opus 5와 같은 241개였으므로, 평균 성능 향상이 추가적인 반복 신뢰성을 확보하지는 못했다. Kimi-K3는 Opus 5보다 한 번 이상 성공한 업무가 75개 많고, Opus 5는 Kimi-K3보다 일관되게 성공한 업무가 173개 많았다. 단일 시도 성공률 대비 20/20 비율은 GPT-6 Astra가 약 78%, 두 Opus 모델이 각각 약 71%를 유지한 반면 GLM-5.1, Kimi-K2.6, DeepSeek-V4-Pro는 각각 약 8%만 유지했다.

6. 단일 성공 시도당 비용의 계산과 한계

원문은 배포 관점에서 점수뿐 아니라 성공한 작업 단위의 비용이 중요하다고 보고, 먼저 성공한 업무 시도 하나당 추정 비용을 계산한다. 각 모델의 전체 507 × 20 실행에서 기록된 토큰 사용량을 OpenRouter에서 제공되는 할인 없는 정가로 가격화했으며, 프로모션 할인을 되돌리고 양자화를 명시한 엔드포인트는 제외했다. 입력·출력·캐시 요금은 모델마다 하나의 제공자 엔드포인트를 기준으로 적용했고, 507개 업무를 한 번씩 실행하는 추정 비용을 507 × pass@1로 나눴다. GPT-5.4의 경우 507회 시도에 $43.49가 들고 pass@1이 65.36%이므로, $43.49 ÷ (507 × 0.6536)으로 성공 시도당 약 $0.131을 얻는다. 이 값은 모델 간 효율 비교를 위한 지표로 실제 청구서나 운영 환경의 요청 하나당 가격을 뜻하지 않으며, 반복 일관성보다 개별 시도의 성공에 비용을 연결한다.

7. 단일 성공 비용과 정확도의 파레토 경계

단일 성공 비용과 pass@1을 함께 비교하면, 다른 모델이 더 비싸지 않으면서 정확도까지 같거나 높을 경우 해당 모델은 비용 경계에서 제외된다. 이 기준을 충족하는 모델은 GPT-5.6 Sol, GPT-5.4, Claude Opus 5.5의 세 가지이며, 각각 더 높은 정확도에 더 많은 비용을 지불하는 선택지를 형성한다. GPT-5.6 Sol은 성공 시도당 $0.127로 가장 저렴하고, GPT-5.4는 $0.004를 더 지불하면 pass@1이 3.45%포인트 높아진다. Claude Opus 5.5는 성공 시도당 $0.276에 GPT-5.4보다 pass@1이 1.80%포인트 높아, 더 저렴한 모델이 같은 정확도를 제공하지 못한다는 조건을 충족한다. 반면 Claude Opus 5는 성공 시도당 $0.475와 pass@1 66.50%로, $0.276에 67.16%를 기록한 Claude Opus 5.5보다 비용과 정확도 양쪽에서 불리하다. 이 비교는 개별 성공의 경제성을 설명하지만, 같은 업무를 매번 정확히 처리하는 데 드는 비용은 다음 계산에서 별도로 다룬다.

8. 20회 모두 성공한 업무당 비용으로 바뀌는 선택

반복 일관성의 비용은 507개 업무를 20회씩 실행한 전체 추정 비용을 20회 모두 성공한 업무 수로 나눠 계산한다. GPT-6 Astra는 전체 실행 비용 $1,720.60을 231개 업무로 나눠 업무당 $7.45가 되며, GPT-5.4는 128개 업무에 $6.80으로 가장 낮고 Claude Opus 5.5는 241개 업무에 $7.80이다. 이 세 모델은 더 많은 20/20 업무를 확보할수록 업무당 비용도 높아져 어느 하나가 나머지를 모두 압도하지 않지만, Claude Opus 5는 동일한 241개 업무에 $13.30이므로 Claude Opus 5.5보다 불리하다. 단일 성공 비용이 가장 낮았던 GPT-5.6 Sol은 20/20 업무가 82개이고 업무당 비용은 $9.76이어서, 개별 성공에서의 비용 우위가 반복 일관성에서도 유지되지는 않는다. 나머지 표의 수치는 Claude Sonnet 4.6이 102개에 $15.56, GPT-5.2가 44개에 $19.95, Kimi-K3가 68개에 $20.68, Qwen3.8-27B가 38개에 $24.36이며 모두 실제 청구액이 아닌 추정치다.

9. 실패 진단과 제공된 원문의 범위

ThinkingBox는 실패한 실행 기록마다 하나의 결정론적 진단 범주를 부여하고, 비교 실험의 모델별 실패 비중을 비가중 평균해 제시한다. 도구 사용 문제가 79.9%로 가장 컸고, 잘못된 상태 갱신은 10.3%, 사용자 문제 해결의 불완전성은 7.0%, 상태 변경 행동이 없는 경우는 2.9%였다. 원문은 이를 근거로 실패 약 다섯 건 중 네 건이 추론보다 도구 처리에 해당한다고 강조하며, 실패를 구체적인 관측 범주로 나누는 방향을 제시한다. 다만 제공된 본문은 이 비중의 성격을 설명하는 문장 도중 끝나므로, 이후의 실패 분석이나 구현·실행 절차에 관한 세부 내용은 확인할 수 없다. 글의 앞부분은 ThinkingBox가 Hugging Face를 통해 제공되며 OpenEnv로 벤치마크를 실행할 수 있다고 소개하지만, 목차에 있는 실행 방법과 향후 방향의 실제 설명은 제공된 본문에 포함돼 있지 않다.

🧾 핵심 주장 / 시사점

  • 도구가 오류 없이 실행되고 기록을 변경했다는 사실만으로 업무 성공을 판정하면, 잘못된 최종 상태와 누락되거나 추가된 효과를 놓칠 수 있다.
  • Kimi-K3와 Claude Opus 5의 비교는 수행 가능한 업무 범위를 넓히는 능력과 같은 업무를 반복해서 정확히 처리하는 능력이 서로 다른 평가 축임을 보여준다.
  • 비용의 분모를 개별 성공 시도에서 20/20 업무로 바꾸면 모델의 경제성 순위도 달라지므로, 가격 비교는 필요한 일관성 수준과 함께 해석해야 한다.

✅ 액션 아이템

  • ThinkingBox의 성공 기준에 따라 정상 종료 여부와 함께 최종 백엔드 상태의 필드값, 필수·불필요한 부수 효과를 평가한다.
  • 실제 기록을 변경하는 업무에서는 Kimi-K3와 Claude Opus 5 계열의 pass@20과 observed 20/20을 비교해 수행 가능 범위와 반복 일관성을 구분한다.
  • GPT-5.4·GPT-6 Astra·Claude Opus 5.5는 OpenRouter 정가 기준의 20/20 업무당 비용과 해당 업무 수를 함께 비교한다.

❓ 열린 질문

  • ThinkingBox에서 실패 시도의 67.24%가 정상 종료한 점을 고려하면, 최종 백엔드 상태와 부수 효과의 어떤 검증을 강화해야 할까?
  • Kimi-K3의 pass@20 93.89%와 observed 20/20 13.41% 사이의 격차는 어떤 업무에서 모델 선택을 바꿀 만큼 중요한가?
  • OpenRouter 정가로 산출한 GPT-5.4의 $6.80과 GPT-6 Astra의 $7.45는 실제 사용 조건에서도 같은 비용 순위를 보일까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.