Articleaws.amazon.com·2026년 9월 11일·0

Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload

Quick Summary

Amazon Bedrock의 OpenAI 모델 비교에서는 토큰 단가보다 품질·토큰 사용량·에이전트 턴 수를 반영한 성공 결과당 비용이 중요하며, 테스트된 구성과 표본에서는 가격 인하 후 gpt 5.6 luna가 가장 낮은 성공 결과당 비용을 기록했다.

Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload 관련 대표 이미지

🖼️ 인포그래픽

Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload의 핵심 내용을 4단계로 요약한 인포그래픽
Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Amazon Bedrock의 OpenAI 모델 비교에서는 토큰 단가보다 품질·토큰 사용량·에이전트 턴 수를 반영한 성공 결과당 비용이 중요하며, 테스트된 구성과 표본에서는 가격 인하 후 gpt-5.6-luna가 가장 낮은 성공 결과당 비용을 기록했다.

📌 핵심 요약

  • 비교 대상은 Amazon Bedrock의 gpt-5.6-luna·gpt-5.6-terra·gpt-5.6-sol과 OpenAI API의 gpt-5.4-mini·gpt-5.4-nano다. 동일한 Responses API 평가 경로를 사용했지만 Bedrock 모델은 추론을 비활성화하고 기준 모델은 기본 설정으로 실행했으므로, 결과는 순수 모델 능력보다 실제 배포 구성의 차이를 반영한다.
  • gpt-5.6-sol의 정확도는 AIME 75%, GPQA Diamond 68%, MMLU-Pro 82%로 mini의 37%·43%·59%보다 높았다. 2026년 7월 30일 luna 80%·terra 20% 가격 인하를 반영한 AIME 정답당 비용은 luna $0.0021, mini $0.0139였으며, luna는 해당 표본들에서 nano보다도 낮은 정답당 비용을 기록했다.
  • DeepSearchQA 50문항에서는 mini가 문항당 평균 7.6턴과 입력 114k토큰을 사용했고, terra의 입력은 50k토큰이었다. 통과 답변당 비용은 luna $0.05, terra $0.31, mini $0.40, nano $0.07이었으며, 평균 F1은 terra 0.50, mini 0.39였다. 통과 기준은 F1 ≥ 0.7이고 nano의 통과율은 18%였다.
  • GDPval 48개 전문 산출물 평가에서 가격 인하 후 luna의 통과율은 56%, 통과 산출물당 비용은 $0.010으로 mini의 42%·$0.030 및 nano의 35%·$0.012보다 유리했다. 다만 출력 상한 8,192토큰으로 luna 6개, terra 9개, sol 7개, mini 0개, nano 1개가 잘렸으며, 상한 확대는 품질과 비용을 함께 바꿀 수 있다.
  • 원문은 대량·저복잡도 작업과 문서 생산에는 luna, 도구 호출을 연결하는 에이전트에는 luna·terra, 엄격한 고난도 정확도 요구에는 sol을 우선 검토하도록 제안한다. 지연 시간은 2026년 7월 특정 리전의 시점별 관측이며, 표본은 48~198개이므로 작은 차이를 확정적으로 해석하지 말고 실제 워크로드·추론 티어·리전 가격·지연 시간 SLO에 맞춰 재측정해야 한다.

🧩 주요 포인트

  1. 정확도와 청구 토큰량이 함께 비용을 결정 → 낮은 토큰 단가보다 허용 품질에서의 성공 결과당 비용을 모델 선택 기준으로 삼을 필요가 있다.
  2. 대화 이력을 매번 재전송하는 에이전트는 턴 수에 따라 누적 입력 비용이 대략 제곱으로 증가할 수 있음 → DeepSearchQA처럼 여러 단계의 도구 호출이 필요한 작업은 전체 실행 경로의 비용과 품질을 함께 비교해야 한다.
  3. 추론 설정 차이·48~198개 표본·8,192토큰 출력 상한·특정 리전의 지연 시간 관측이 결과에 영향 → gpt-5.6-luna의 비용 우위와 sol의 품질 프리미엄을 실제 작업의 품질 기준 및 검토·재작업 비용으로 검증해야 한다.

🧠 상세 정리

1. 토큰 가격에서 성공 결과의 비용으로

원문은 생성형 AI 모델을 비교할 때 흔히 사용하는 100만 토큰당 가격만으로는 실제 운영 비용을 설명하기 어렵다는 문제에서 출발한다. 기업이 구매하는 가치는 해결된 지원 요청, 완성된 조사 보고서, 정확한 재무 요약이며, 이 결과를 얻는 비용에는 정답률과 토큰 사용량, 에이전트의 반복 턴 수가 함께 작용한다. 비교 대상은 Amazon Bedrock의 gpt-5.6-luna·gpt-5.6-terra·gpt-5.6-sol과 OpenAI API의 gpt-5.4-mini·gpt-5.4-nano로, 뒤의 두 모델은 동세대의 동등한 비교군이 아니라 비용 최적화를 위해 흔히 선택하는 출발점으로 선정됐다. 따라서 글의 중심 질문은 현재 mini나 nano를 사용하는 팀이 Bedrock의 새로운 모델로 옮겼을 때 비용과 품질에서 이득을 얻을 수 있는지다. 이를 정답 한 개의 비용, 여러 턴으로 구성된 에이전트 실행 비용, 전문가가 수용할 만한 산출물의 품질이라는 세 축으로 나눠 평가한다.

2. 공통 평가 경로와 비교의 한계

오픈소스 평가 도구 openai-on-aws/benchmarks-openai는 다섯 모델 모두에 동일한 OpenAI Responses API 클라이언트를 사용하고, 평가 로직을 유지한 채 백엔드와 모델 ID를 바꾼다. 그러나 Amazon Bedrock 모델은 추론을 비활성화했고 OpenAI API의 기준 모델은 기본 설정으로 실행했으므로, 측정값에는 모델 자체뿐 아니라 제공자 인프라와 모델별 설정의 차이도 포함된다. 원문은 이를 순수한 모델 능력을 통제해서 추정한 실험이 아니라 실용적인 배포 구성의 비교라고 명시한다. 평가는 AIME·GPQA Diamond·MMLU-Pro의 단일 호출, 실시간 웹 조사 에이전트, 전문 산출물을 포괄하며, 결정론적 검사와 평가 대상에 포함되지 않은 gpt-5.5 판정기를 함께 사용한다. 판정 프롬프트는 고정하고 해시를 결과에 기록하며, 실행 시각이 포함된 JSON 파일에서 수치와 그래프를 생성한다. 표본 규모가 48~198개이므로 불확실성 추정이 없는 작은 격차는 방향성을 보여주는 정도로 해석하고, 선택 전에 자체 작업으로 재현하도록 권고한다.

3. 정답률과 토큰 효율이 바꾸는 비용

정답당 비용은 오답을 포함한 전체 시도에 지출한 금액을 정답 수로 나눠 계산하므로, 가격표에 드러나지 않는 실패 비용까지 반영한다. gpt-5.6-sol은 AIME에서 75%의 정확도로 mini의 37%를 앞섰고, GPQA Diamond에서는 68% 대 43%, MMLU-Pro에서는 82% 대 59%를 기록했다. 정확도가 일정하고 시도가 독립적이라면 37% 정확도는 성공 한 번에 평균 약 2.7회의 시도를 뜻하지만, 실제 재시도는 서로 연관되므로 이 추정치를 그대로 적용해서는 안 된다고 설명한다. luna는 원래 정가가 mini의 약 1.5배였을 때도 추론 비활성화 구성에서 청구 토큰을 덜 사용해 AIME 정답당 비용이 25% 낮았고, 2026년 7월 30일 luna 80%·terra 20% 가격 인하 후에는 luna $0.0021 대 mini $0.0139가 됐다. 결과 파일은 luna의 입력·출력 100만 토큰당 가격을 $0.22·$1.32, terra를 $2.20·$13.20으로 사용하지만, 원문은 가격 인하 발표와 가격 페이지 반영 시점이 다를 수 있으므로 적용되는 Bedrock 추론 티어와 리전의 실제 가격을 확인하라고 명시한다. 기록된 가격 가정에서 nano의 명목 토큰 단가는 조금 더 낮아도 luna가 해당 표본들에서 가장 낮은 정답당 비용을 보였다는 점이 핵심이다.

4. 에이전트의 턴 수가 만드는 누적 비용

에이전트 평가에서는 store: false와 클라이언트 관리 이력을 사용하므로, 매 턴 시스템 프롬프트와 이전 도구 결과, 대화 문맥을 다시 전송한다. 턴별 문맥이 대략 선형으로 커지면 누적 청구 입력은 턴 수의 제곱에 가까운 형태로 증가할 수 있고, 각 턴은 왕복 지연도 추가하므로 8턴을 5턴으로 줄이는 효과가 턴 수 감소율인 37%보다 클 수 있다. 이를 확인하기 위해 DeepSearchQA의 층화 표본 50문항을 실제 web_search와 fetch_page 도구로 실행하고, 결정론적 사전 검사와 고정된 gpt-5.5 판정기를 거쳐 F1 ≥ 0.7을 통과로 판정했다. mini는 주로 재검색 반복으로 문항당 평균 7.6턴을 사용했고, 입력 토큰은 114k로 terra의 50k보다 약 2.3배 많았다. terra는 더 높은 토큰 가격에도 턴 수와 품질의 이점으로 통과 답변당 $0.31을 기록해 mini의 $0.40보다 낮았으며, 평균 F1도 0.50 대 0.39로 높았다. luna는 mini보다 적은 턴으로 통과 답변당 $0.05를 기록했고 nano는 18% 통과율에서 $0.07이었지만, 원문은 50문항이라는 규모 때문에 가까운 격차를 확정적으로 해석하지 말라고 경고한다.

5. GDPval로 본 전문 산출물의 품질

원문은 정답 문자열을 맞히는 시험에서 실제 업무 문서로 논의를 옮기며, 규정 준수 보고서나 재무 계획, 돌봄 프로토콜은 세부 평가 기준에 따라 품질을 판단해야 한다고 설명한다. GDPval에서는 평균 경력 14년의 전문가들이 만든 실제 직무 산출물 과제 중 48개를 사용하고, 사람이 작성한 평가 기준의 가중 점수 70% 이상을 통과로 정의했다. 추론을 비활성화한 세 gpt-5.6 구성 모두 mini와 nano보다 높은 관측 평가 점수를 얻었으며, 특히 구체적인 유의사항과 구조, 완결성을 요구하는 법률·간호·재무 조언 과제에서 큰 차이가 나타났지만 분야별 표본이 작아 탐색적 결과로 봐야 한다. luna는 48개 중 31개에서 mini보다 높은 점수, 9개에서 낮은 점수, 8개에서 동점을 기록했고, 통과 건수는 27개 대 20개였다. 단일 호출인 이 작업에서는 가격 인하 전 mini와 nano의 통과당 비용이 더 낮았지만, 인하 후 luna는 통과율 56%와 통과당 $0.010으로 mini의 42%·$0.030 및 nano의 35%·$0.012보다 유리해졌다. terra와 sol은 더 높은 평가 성능과 함께 통과당 비용 프리미엄이 남아 있으므로, 그 가치가 있는지는 대상 업무의 검토와 재작업 비용에 달려 있다.

6. 출력 상한이 품질과 비용에 미치는 영향

GDPval 결과를 해석할 때 중요한 제약은 모든 산출물의 출력이 8,192토큰으로 제한됐다는 점이다. 이 상한 때문에 luna 6개, terra 9개, sol 7개, mini 0개, nano 1개의 산출물이 잘렸으므로, 관측된 품질에는 모델이 작성한 내용뿐 아니라 제한 안에서 문서를 완성했는지도 반영된다. 원문은 잘린 결과를 시험된 상한 아래에서 실제로 발생한 성과로 취급하며, 더 높은 출력 한도라면 동일한 결과가 나올 것이라고 가정하지 않는다. 상한을 높이면 품질이 개선될 수 있지만 토큰 사용과 비용도 증가할 수 있어, 품질만 개선된다고 단정하거나 현재의 통과당 비용이 유지된다고 볼 근거는 없다. 따라서 이 평가는 해당 출력 제약 아래의 결과로 읽어야 하며, 상한 변경의 효과는 품질과 비용을 함께 시험해야 한다.

7. 워크로드별 모델 선택 기준

선택 기준은 현재 mini나 nano를 사용하는 작업의 성격에 따라 달라지며, 원문은 실패 비용이 낮은 대량·저복잡도 작업에 Amazon Bedrock의 gpt-5.6-luna를 출발점으로 제시한다. 대화형 애플리케이션도 luna를 먼저 벤치마크하되, 성공당 비용과 함께 실제 지연 시간 SLO를 충족하는지 다시 측정하도록 권한다. 조사나 여러 단계의 조회처럼 도구 호출을 연결하는 에이전트에는 luna와 terra를 비교 대상으로 제안하는데, 두 모델은 mini보다 적은 턴과 높은 DeepSearchQA F1을 기록했고 luna의 통과 답변당 비용은 해당 표본에서 약 8분의 1이었다. 일정 품질을 통과해야 하는 문서 생산에는 GDPval에서 luna가 비용 효율형 모델 중 가장 높은 통과율을 보이고 통과당 비용도 가장 낮았다는 점을 근거로 luna를 제안한다. 반면 어려운 작업에서 정확도가 필수 조건이고 저비용 구성이 품질 기준에 미달한다면, AIME 75%와 GDPval 31/48 통과를 기록한 gpt-5.6-sol을 별도의 능력·가격 등급으로 평가하도록 한다. 이러한 권고는 모든 작업의 보편적 순위라기보다, 실제 품질 기준과 성공 결과의 비용을 연결하는 검증 출발점이다.

8. 지연 시간 관측과 자체 재현의 필요성

동일 모델을 양쪽 서비스에서 같은 스트리밍 도구로 측정한 2026년 7월 us-west-2 실행에서는, 대응되는 12개 구성에 걸쳐 첫 토큰 도착 시간 중앙값이 Amazon Bedrock에서 luna는 평균 21%, terra는 5% 낮았다. 출력이 500토큰 이상일 때 처리량은 Bedrock의 luna가 평균 43%, terra가 4% 높았지만, 공유 서비스 성능은 부하에 따라 달라지므로 특정 리전과 시점의 관측으로 해석해야 한다. 관측된 최악의 첫 토큰 도착 시간을 중앙값으로 나눈 비율은 Bedrock 2.1~2.5배, OpenAI API 4.6~6.6배였으며, 이 최댓값들은 지연의 꼬리 변동성을 보여줄 뿐 p99 지연 시간 추정치는 아니다. sol은 첫 토큰 도착 시간이 본질적으로 길고 변동성이 큰 심층 추론 모델로 설명되며, Bedrock 실행 리전도 us-east-1이어서 luna·terra와 조건이 다르다. 원문은 저장소의 성능 항목과 performance/run_all.sh를 통해 자체 계정에서 비교를 재현할 수 있다고 안내한다. 최종 선택에서는 관측된 비용과 품질뿐 아니라 실제 서비스 환경의 지연 시간, 설정, 적용 가격을 함께 다시 확인해야 한다는 방향으로 논의를 마무리한다.

🧾 핵심 주장 / 시사점

  • luna의 비용 우위는 가격 인하만의 결과가 아니다. 테스트된 추론 비활성화 구성의 토큰 효율이 인하 전부터 AIME 정답당 비용을 낮췄고, 가격 인하가 그 차이를 확대했다.
  • 에이전트의 여러 턴은 단순한 호출 횟수 증가를 넘어 누적 문맥의 재전송을 유발한다. 따라서 terra처럼 토큰 단가가 높은 모델도 실행 경로가 짧고 품질이 높으면 통과 답변당 비용을 낮출 수 있다.
  • 전문 문서에서는 평가 점수와 통과율, 출력 완결성, 검토·재작업 비용을 함께 봐야 한다. terra와 sol의 높은 품질이 추가 비용을 정당화하는지는 해당 업무의 요구 수준에 따라 달라진다.

✅ 액션 아이템

  • 실제 워크로드에서 gpt-5.6-luna와 현재 모델의 성공 결과당 비용을 비교하고, 추론 설정·추론 티어·리전 가격을 함께 확인.
  • DeepSearchQA처럼 도구 호출을 연결하는 에이전트에서 luna·terra·mini의 턴 수, 누적 입력 토큰, 품질과 통과 답변당 비용을 함께 측정.
  • GDPval과 같은 문서 작업에서 8,192토큰 출력 상한 변경에 따른 품질·비용을 시험하고, sol의 품질 프리미엄을 검토·재작업 비용과 함께 평가.

❓ 열린 질문

  • 추론 설정과 추론 티어·리전 가격을 실제 배포 조건에 맞춰도 gpt-5.6-luna의 성공 결과당 비용 우위가 유지되는가?
  • 실제 에이전트에서도 mini의 반복 턴과 누적 입력 토큰이 luna·terra 대비 통과 답변당 비용 차이를 만드는가?
  • 8,192토큰 출력 상한을 높였을 때 문서 품질 개선과 비용 증가는 어느 정도이며, sol의 품질 프리미엄이 검토·재작업 비용 감소로 정당화되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.