Articlelangchain.com·2026년 8월 11일·0

How many of your agent's calls actually need a frontier model?

Quick Summary

Deep Agents 평가에서 NVIDIA NeMo Switchyard는 호출의 93%를 저렴한 모델로 처리해 Claude Opus 4.8 단독 대비 비용을 74% 줄였지만, 정확도는 6%포인트 낮아져 자체 워크로드의 품질 요구와 라우팅 경제성을 함께 검증해야 한다.

How many of your agent's calls actually need a frontier model? 관련 대표 이미지

🖼️ 인포그래픽

How many of your agent's calls actually need a frontier model? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How many of your agent's calls actually need a frontier model?의 핵심 내용을 4단계로 요약한 인포그래픽
How many of your agent's calls actually need a frontier model? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Deep Agents 평가에서 NVIDIA NeMo Switchyard는 호출의 93%를 저렴한 모델로 처리해 Claude Opus 4.8 단독 대비 비용을 74% 줄였지만, 정확도는 6%포인트 낮아져 자체 워크로드의 품질 요구와 라우팅 경제성을 함께 검증해야 한다.

📌 핵심 요약

  • 평가는 평균 6.3회의 모델 호출이 필요한 145개 다단계 작업으로 구성됐으며, 통제된 시나리오에서 모델 간 정확도 차이가 작았으므로 결과를 다른 워크로드에 그대로 일반화할 수 없다.
  • Claude Opus 4.8 단독은 정확도 86.0%·실행당 11.45달러, 라우팅은 80.0%·3.00달러, NVIDIA Nemotron 3.5 Lightning 단독은 77.7%·0.72달러를 기록했다.
  • 라우팅에서 Nemotron 3.5 Lightning은 모델 호출의 93%와 비용의 10.4%, Opus는 호출의 7%와 비용의 68.4%를 차지했으며, 호출 비중 계산에서 제외된 판정 모델은 비용의 21.2%를 차지했다.
  • 라우팅의 저렴한 모델 단독 대비 정확도 개선은 2.3%포인트로 실행 간 변동 약 2.7%포인트보다 작았다. 라우팅 실행 비용은 2.16~3.61달러로 달라져 평균 비용뿐 아니라 상단 범위를 고려해야 한다.
  • 최소 이관 비율은 판정 비용을 고가 모델과 저가 모델의 비용 차이로 나눈 값이며, 실험에서는 5.9%였다. 가격 차이가 작으면 요구 비율이 100%를 넘을 수 있고, 턴마다 약 700밀리초의 판정 지연이 추가되므로 지연에 민감하거나 짧은 작업에는 해당 승격 방식이 부적합하다.

🧩 주요 포인트

  1. 비용 절감의 중심은 호출의 93%를 저렴한 모델로 옮긴 데 있음 → 고가 모델로의 승격이 저가 모델 단독보다 품질을 높였다는 근거는 이번 평가에서 충분하지 않음.
  2. 고가 모델 호출 7%가 비용의 68.4%를 차지하고 판정 모델도 21.2%를 소비함 → 승격 빈도와 판정 비용을 함께 살펴야 비용 수준과 변동을 설명할 수 있음.
  3. 최소 이관 비율은 비용상 가능성만 판별하고 통제된 145개 작업은 실제 트래픽 전체를 대표하지 않음 → 자체 워크로드에서 정확도, 비용 범위, 판정 지연을 비교해야 도입 타당성을 판단할 수 있음.

🧠 상세 정리

1. 모든 호출에 같은 모델을 쓰는 기본값의 재검토

글은 에이전트가 수행하는 많은 모델 호출을 모두 같은 모델에 보내는 관행에서 출발하며, 각 호출에 실제로 최상위 모델의 능력이 필요한지 묻는다. 최상위 모델은 더 비싸고 강력해진 반면 공개 가중치 모델은 에이전트 업무의 상당 부분을 처리할 만큼 빠르고 저렴해졌다는 것이 문제 제기의 배경이다. 파일을 읽는 턴과 테스트 실패 원인을 추론하는 턴은 난도가 다르지만, 단일 모델 구성에서는 같은 토큰 단가를 적용받는다. NVIDIA NeMo Switchyard는 단계별로 모델을 선택해 이런 비용 차이를 활용하는 오픈소스 라우팅 라이브러리다. 저자들은 Deep Agents 평가를 모델 대신 라우터에 연결해 고가 모델로 보내진 호출의 비중과 그에 따른 정확도·비용 변화를 측정했다.

2. 라우팅 전략과 두 번의 부정 판정에 따른 승격

Switchyard는 에이전트가 접속하는 프록시 또는 에이전트 프로세스 내부의 미들웨어로 실행할 수 있으며, 설정한 전략에 따라 공개 모델과 비공개 모델을 조합한다. LLM 분류기 방식은 작은 판정 모델을 사용하며, 호출별 모델 선택, 저가 모델에서 시작하는 승격, 사용자 정의 모드를 제공한다. 이번 실험은 승격 모드를 사용해 모든 작업을 저렴한 모델에서 시작하고, 판정 모델이 완료된 각 턴에서 작업이 올바르게 진행되는지 평가하도록 했다. 부정 판정이 두 번 연속 나오면 해당 작업은 남은 세션 동안 고가 모델로 이동하며, 승격 이후에는 매 턴 판정 모델을 실행하지 않는다. 별도의 단계 기반 라우터는 오류·추론 패턴과 토큰 수 등을 읽어 추가 모델 호출 없이 동작하지만 이번 실험에서는 평가하지 않았다. 사전 채움 단계의 내부 활성화 패턴을 읽는 MLP 방식도 소개되지만, 이는 운영 준비가 끝난 기능이 아니라 연구 단계다.

3. 평가 범위와 세 가지 구성의 측정 결과

평가 대상은 평균 6.3회의 모델 호출을 요구하는 145개 다단계 에이전트 작업으로, 정책 제약이 있는 고객 지원, 운영 장애 조사, 메시징·이슈 추적·이메일을 연결하는 자동화를 포함한다. 도구 사용, 다단계 검색, 파일시스템 작업, 긴 문맥 요약을 다루며 τ²-bench 항공, Berkeley Function Calling Leaderboard, FRAMES, Nexus에서 가져온 시나리오를 활용했다. Opus 4.8 단독 구성은 정확도 86.0%, 실행당 비용 11.45달러, 완료 작업당 비용 0.092달러를 기록했다. Opus와 Nemotron 3.5 Lightning을 연결한 라우팅 구성은 각각 80.0%, 3.00달러, 0.026달러였고, Nemotron 단독은 77.7%, 0.72달러, 0.006달러였다. 비용 계산에는 캐시된 입력의 할인 단가를 반영했다. 통제된 평가에서는 실패 원인을 구분하기 쉽지만 전반적인 정확도가 높고 모델 간 차이가 약 8%포인트에 그쳐, 저자들은 이를 특정 워크로드의 측정값으로 해석해야 한다고 강조한다.

4. 호출 비중과 비용 비중의 큰 불균형

라우팅 구성에서 Nemotron 3.5 Lightning은 모델 호출의 93%를 처리했지만 전체 비용에서는 10.4%만 차지했다. 반대로 Opus는 호출의 7%에 사용됐는데도 비용의 68.4%를 차지해, 적은 수의 고가 호출이 전체 지출을 크게 좌우했다. 이 호출 비중에는 판정 모델이 포함되지 않으며, 판정 모델 자체가 나머지 비용의 21.2%를 소비했다. 판정 모델은 승격 전까지 매 턴 실행되고 프롬프트 캐시의 혜택도 받지 못해, 라우팅 구성에서 두 번째로 큰 비용 항목이 됐다. 라우팅은 Opus 단독 대비 비용을 74% 줄이고 정확도의 약 93%를 유지했지만, 정확도 자체는 6%포인트 낮아졌다. 이 격차는 실행 간 정확도 변동 약 2.7%포인트를 넘으며, Opus 단독으로 마지막 6%포인트를 확보하는 구성은 완료 작업당 비용이 라우팅의 약 3.5배였다.

5. 평균 절감률과 별도로 관리해야 하는 비용 범위

다섯 번의 라우팅 실행에서 최상위 모델로 보내진 호출은 4.1~9.1%였고 평균은 6.9%로, 가장 많은 실행과 가장 적은 실행 사이에 두 배가 넘는 차이가 있었다. Opus 호출당 비용은 0.0324달러로 Nemotron 3.5 Lightning의 0.00037달러보다 약 87배 높아, 승격 비중의 차이가 실행 비용 2.16~3.61달러로 이어졌다. 라우터의 승격 결정 외에 조건이 바뀌지 않았는데도 비용이 67% 움직였으므로, 저자들은 평균 하나보다 관측 범위의 상단을 기준으로 예산을 고려하라고 설명한다. 반면 Opus 단독 비용은 세 번의 실행에서 1.5%만 변동했고, 라우팅의 실행별 절감률은 68.5~81.1%였다. 승격 전에 필요한 부정 판정 횟수를 정하는 confirmations 값을 낮추면 고가 모델로 더 자주 이동한다. 판정 모델을 저렴하게 바꾸거나 명백히 순조로운 턴의 판정을 생략하는 것도 판정 비용을 줄이는 수단으로 제시된다.

6. 저렴한 모델만 사용하는 편이 낫다는 반론

저자들은 Nemotron 3.5 Lightning 단독이 실행당 0.72달러로 정확도 77.7%를 기록했다면 라우터가 왜 필요한지라는 반론을 직접 다룬다. 라우팅은 비용이 4.2배였지만 정확도 개선은 2.3%포인트에 그쳤고, 이 차이는 실행 간 변동 약 2.7%포인트보다 작아 저가 모델 단독보다 우수하다고 단정할 수 없다. 따라서 비용 최소화가 우선이며 실제 트래픽이 이번 평가와 비슷하다면 저렴한 모델 단독 구성이 더 나은 선택이라고 명시한다. 다만 이 비교에는 145개 작업의 결과를 이미 알고 있다는 사후적 관점이 포함돼 있으며, 운영 중에는 새 요청의 난도를 미리 알 수 없다는 점도 짚는다. 라우팅은 어떤 요청에 최상위 능력이 필요한지 미리 구분하기 어려운 팀을 위한 선택으로 설명되며, 가장 비싼 라우팅 실행도 3.61달러로 Opus 단독의 약 3분의 1이었다. 이는 어려운 요청을 위한 능력 접근성과 비용의 절충 논거이지, 이번 평가에서 품질 개선이 입증됐다는 뜻은 아니다.

7. 판정 비용을 회수할 수 있는 최소 이관 비율

원문은 라우팅 구현에 앞서 최소 이관 비율을 계산하도록 제안하며, 식은 판정 비용을 고가 모델 비용과 저가 모델 비용의 차이로 나눈 값이다. 판정 모델은 실제 승격이 발생하지 않아도 승격 전의 턴마다 실행되므로, 저가 모델로 보낸 호출에서 얻는 절감액이 이 추가 부담을 넘어야 한다. 실험에서는 실행당 판정 비용 0.64달러와 두 모델의 비용 차이 10.73달러를 적용해 최소 이관 비율 5.9%를 얻었고, 실제 93% 이관은 이를 약 16배 웃돌았다. 두 모델의 가격이 비슷하면 필요한 비율이 100%를 초과해 이 계산상 비용 회수가 불가능하며, 판정 설정만으로는 그 문제를 해결할 수 없다고 설명한다. 원문은 NVIDIA DGX Spark 같은 장비에 저가 모델을 직접 호스팅해 추론 비용을 거의 없애는 경우를 예외로 제시한다. 다만 이 식은 좋은 라우팅 결정이 경제적으로 가치 있는지만 보여줄 뿐, 실제 트래픽에서 올바른 모델을 선택할지는 자체 평가로 확인해야 한다.

8. 지연·작업 길이의 제약과 재현 방법의 범위

승격 방식의 LLM 분류기는 턴마다 판정을 위한 두 번째 모델 호출을 추가하며, 원문은 그 지연을 약 700밀리초로 제시한다. 단계 기반 라우터의 추가 지연은 사실상 없다고 설명하지만 해당 방식은 이번 벤치마크 대상이 아니므로, 측정된 정확도와 비용 결과를 그대로 연결할 수 없다. 승격에는 진행 상태를 읽을 여러 턴의 궤적이 필요하므로 짧은 작업이나 지연에 민감한 워크로드에는 이 방식이 적합하지 않다. 실험 재현을 위해서는 NVIDIA-NeMo/Switchyard에서 서버를 시작하고, 에이전트의 base_url을 해당 서버로 지정한 뒤 설정 파일에 모델을 기술하는 절차가 제시된다. 제공된 설정에는 NVIDIA, Anthropic, Gemini 클라이언트의 형식과 접속 주소, API 키 환경변수 항목이 나타난다. 그러나 제공된 원문은 대상 모델 설정이 시작되는 지점에서 끊기므로, 완전한 실행 설정이나 이후의 통합 예제까지 확인할 수는 없다.

🧾 핵심 주장 / 시사점

  • 라우팅이 최상위 모델 단독보다 저렴하다는 결과와 저가 모델 단독보다 우수하다는 주장은 구분해야 한다. 이번 실험은 전자를 보여주지만, 후자는 실행 간 변동을 넘어서는 근거가 부족하다.
  • 호출의 대부분을 저가 모델로 옮겨도 고가 호출과 판정 모델이 비용 대부분을 차지할 수 있으므로, 호출 비중만으로 전체 비용 구조를 판단하기 어렵다.
  • 최소 이관 비율 계산은 경제성이 없는 모델 조합을 걸러내는 기준이며, 도입 여부는 실제 워크로드의 정확도 손실, 비용 변동, 지연 허용 범위까지 비교해야 결정할 수 있다.

✅ 액션 아이템

  • 자체 워크로드에서 Claude Opus 4.8 단독, NVIDIA Nemotron 3.5 Lightning 단독, 라우팅의 정확도와 비용을 비교해 6%포인트 정확도 저하의 수용 가능성 검증.
  • 판정 비용과 고가 모델·저가 모델의 비용 차이로 최소 이관 비율을 계산하고, 예상 이관 비율이 경제성 기준을 넘는지 확인.
  • 라우팅 실행 비용 2.16~3.61달러와 판정 지연 약 700밀리초를 참고해 자체 워크로드의 비용 상단과 지연 허용 범위 평가.

❓ 열린 질문

  • 자체 워크로드에서도 라우팅의 Claude Opus 4.8 단독 대비 6%포인트 정확도 저하를 수용할 수 있는가?
  • 선택한 모델 조합의 판정 비용과 비용 차이로 계산한 최소 이관 비율은 얼마이며, 실제 이관 비율이 이를 넘는가?
  • 자체 워크로드의 작업 길이와 응답 시간 요구는 턴마다 약 700밀리초가 추가되는 판정 지연을 감당할 수 있는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.