Articleopenai.com·2026년 9월 22일·0

Better prompt caching for GPT-6

Quick Summary

OpenAI는 GPT‑6의 기본 프롬프트 캐시 적중률을 높이고, 30분 이내 재사용하는 적격 공통 접두부에 캐시 할인을 적용하며, 지속 실행 에이전트의 비용과 지연을 줄이는 관측·진단·제어 도구를 소개했다.

Better prompt caching for GPT-6 관련 대표 이미지

🖼️ 인포그래픽

Better prompt caching for GPT-6 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Better prompt caching for GPT-6의 핵심 내용을 4단계로 요약한 인포그래픽
Better prompt caching for GPT-6 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI는 GPT‑6의 기본 프롬프트 캐시 적중률을 높이고, 30분 이내 재사용하는 적격 공통 접두부에 캐시 할인을 적용하며, 지속 실행 에이전트의 비용과 지연을 줄이는 관측·진단·제어 도구를 소개했다.

📌 핵심 요약

  • 2026년 9월 22일 발표에 따르면 GPT‑6 제품군은 기본 캐시 적중률을 개선했으며, 30분 이내 재사용하는 적격 공통 접두부에 할인을 적용한다. 캐시된 입력 토큰의 할인율은 최대 90%다.
  • Prompt Caching Dashboard는 캐시 적중률 추이와 캐시·비캐시 입력 토큰 구성을 보여준다. 프롬프트 캐싱 진단 도구는 최근 응답과 요청을 비교해 모델·도구·설정·입력 변경에 따른 캐시 실패 원인과 영향받은 토큰 수 추정치를 제공한다.
  • 명시적 캐시 분기점으로 재사용할 프롬프트 접두부를 선택할 수 있다. GPT‑6에서는 요청 수준의 reasoning effort를 유지하면서 configuration_update를 덧붙여 응답 사이의 추론 강도를 바꿔도 캐시를 보존할 수 있다.
  • 도구 정의·스키마·순서를 유지하고 allowed_tools 또는 tool_choice의 none 설정으로 호출 가능 도구를 조절하며, 새 developer 메시지를 문맥 뒤쪽에 추가해 지시를 갱신하는 방식을 권장한다. 프리워밍은 알려진 문맥을 미리 처리해 사용자 대기 시간을 줄인다.
  • 고객 증언에서 GitHub Copilot은 수십억 건의 요청에서 신규 처리가 필요한 프롬프트 토큰 비중을 이전 기준 대비 50% 넘게 줄였다고 밝혔다. Arian Hanifi는 비용 20% 절감을, Manus의 Bin Fan은 일주일 미만에 적중률이 약 85%에서 지속적으로 90% 초과로 개선됐다고 보고했다. Eugene Mikhantyev는 평가 적중률이 83%에서 91%로 오르고 캐시 쓰기가 약 3분의 2, 추론 비용이 36% 줄었다고 밝혔다.

🧩 주요 포인트

  1. 공통 접두부 재사용과 30분 할인 창 → 반복 문맥을 전달하는 지속 실행 에이전트의 입력 비용과 응답 지연을 줄이는 기반.
  2. Prompt Caching Dashboard와 프롬프트 캐싱 진단 도구 → 적중률 하락을 발견하고 변경 원인 및 토큰 영향을 파악해 개선 대상을 좁히는 수단.
  3. 명시적 캐시 분기점·configuration_update·안정적인 도구 정의·프리워밍 → 재사용 문맥을 보존하면서 작업별 추론 강도와 도구 사용을 조절하고 처리 시점을 앞당기는 방식.

🧠 상세 정리

1. 지속 실행 에이전트를 위한 기본 캐싱 개선

OpenAI는 2026년 9월 22일 GPT‑6 제품군의 개선된 프롬프트 캐싱과 이를 관리하는 새 도구를 소개했다. GPT‑6로 구동되는 지속 실행 에이전트는 코드베이스 리팩터링부터 충분한 조사를 거친 문서와 발표 자료 제작까지 복잡한 작업을 수 시간 동안 수행할 수 있다. 이러한 애플리케이션은 앞선 요청을 바탕으로 API 요청을 이어가며 동일한 지시, 도구 정의, 문맥을 반복 전달하는 경우가 많다. OpenAI는 이 공통 문맥의 계산을 재사용해 응답 시간을 줄이고 캐시된 입력 토큰에 최대 90% 할인을 제공한다. GPT‑6 제품군에서는 기본 캐시 적중률을 높였으며, 30분 이내 재사용되는 적격 공통 접두부에 캐시 할인을 적용한다.

2. 대규모 활용 사례와 캐시 성능 관측

GitHub Copilot 사례에서 최고제품책임자 Mario Rodriguez는 프롬프트 캐싱이 대규모 환경에서 빠르고 효율적인 경험을 제공하는 데 핵심 역할을 한다고 설명했다. 그의 증언에 따르면 지난 몇 달 동안 OpenAI 모델에 보낸 수십억 건의 요청에서 신규 처리가 필요한 프롬프트 토큰 비중이 이전 기준보다 50% 넘게 감소했다. 그는 그 결과 추론 시스템의 효율이 높아지고 개발자가 첫 응답을 받기까지 걸리는 시간이 줄었다고 밝혔다. 새 Prompt Caching Dashboard는 애플리케이션 입력 중 캐시에서 제공되는 양과 시간에 따른 적중률을 보여준다. 입력 구성 차트에서는 캐시된 토큰과 캐시되지 않은 토큰을 비교할 수 있어, 적중률 하락을 발견하고 애플리케이션 변경이 캐싱 성능에 미치는 영향을 평가할 수 있다.

3. 캐시 실패 진단과 재사용 범위 선택

예상하지 못한 캐시 실패가 발생하면 프롬프트 캐싱 진단 도구로 요청을 최근 응답과 비교해 원인을 살펴볼 수 있다. 이 도구는 모델, 도구, 설정 또는 입력의 어떤 변화가 재사용을 막았는지 식별하고, 영향받은 토큰 수의 추정치를 제공해 실패의 규모와 최적화 방향을 판단하도록 돕는다. 원문의 예시는 실패 유형을 cache_miss, 원인을 tools_changed로 표시하고 comparison_reusable_tokens와 cache_missed_tokens를 각각 5629로 제시한다. 명시적 캐시 분기점은 개발자가 재사용할 프롬프트 접두부를 직접 선택하게 한다. 개정된 프롬프트 캐싱 가이드는 분기점 사용법, 캐시된 접두부의 재사용 자격 유지 기간, 도구와 입력 변경이 재사용에 미치는 영향을 설명한다.

4. 추론 강도와 도구·지시 변경 시 캐시 보존

GPT‑6 모델에서는 응답 사이에 추론 강도를 바꾸면서도 캐시를 유지할 수 있다. 구체적으로 요청 수준의 reasoning effort는 그대로 두고 configuration_update를 덧붙여, 어려운 작업에서는 추론 강도를 높이거나 일상적인 후속 작업에서는 낮춘다. 도구 사용 요구가 달라질 때는 도구 정의, 스키마, 순서를 안정적으로 유지해 앞선 문맥이 계속 재사용되도록 하는 것이 권장된다. 정의를 제거하는 대신 allowed_tools로 관련 도구만 호출 가능하게 하거나, 도구가 필요 없으면 tool_choice를 none으로 설정할 수 있다. 지시를 갱신할 때는 새 developer 메시지를 문맥 뒤쪽에 추가해 이전 지시를 덮어쓰는 방식이 제시된다.

5. 프리워밍과 선택적 제어의 경제적 효과

프리워밍은 이미 알려진 문맥을 요청 전에 준비해, 실제 요청이 도착했을 때 모델이 더 빨리 응답을 시작하도록 하는 기능이다. 예를 들어 애플리케이션 시작 시 사용자의 첫 질문을 기다리지 않고 공통 지시, 도구 정의 또는 참고 자료를 미리 처리해 사용자 대기 시간에서 해당 처리를 덜어낼 수 있다. 이러한 제어 기능은 엔진의 기본 성능에 더해지는 선택 사항이며, 작업 특성에 맞게 캐싱을 조정하도록 돕는다. 최고기술책임자 Arian Hanifi는 진단 도구와 대시보드로 적중률을 몇 퍼센트포인트 높여 비용을 20% 줄였고, 예기치 않은 캐싱 중단 알림과 Codex 에이전트로 원인을 진단한다고 밝혔다. 또한 명시적 분기점으로 안정적인 문맥을 캐시하고 자주 바뀌는 내용을 끝에 배치해, 공통 문맥 대부분을 재사용하는 백그라운드 작업용 대화 분기가 경제적으로 가능해졌다고 설명했다.

6. 고객별 개선 결과와 적용 안내

Manus의 에이전트 팀 리드 Bin Fan은 장시간 실행되는 에이전트의 경제성에 안정적인 캐싱이 필수적이라고 설명했다. OpenAI 엔지니어링 팀과 분기점 배치를 조정하고 명시적·자동 캐싱을 결합하며 실제 요청의 예상 밖 실패를 분석한 결과, 일주일 미만에 OpenAI 모델 캐시 적중률이 약 85%에서 지속적으로 90%를 넘는 수준으로 올랐다고 밝혔다. AI 엔지니어 Eugene Mikhantyev는 세션 에이전트에 명시적 캐시 분기점을 도입한 뒤 일주일 미만에 평가 적중률이 83%에서 91%로 상승했다고 보고했다. 그의 사례에서는 동일한 작업량에서 캐시 쓰기가 약 3분의 2 감소하고 추론 비용이 36% 줄었으며, 이는 앞선 고객들의 수치와 구분되는 개별 결과다. 글은 대시보드로 적중률을 관찰하고 진단 도구로 실패를 조사하며, 가이드를 따르거나 Codex로 코드를 검토하고 개선을 적용해 결과를 측정하도록 안내한다.

🧾 핵심 주장 / 시사점

  • 지속 실행 에이전트에서는 반복되는 지시·도구 정의·문맥의 재사용이 누적 비용과 응답 지연을 좌우하므로, 기본 적중률 개선과 재사용 가능한 입력 구조가 함께 중요하다.
  • configuration_update와 도구 호출 제어는 작업별 동작 조절과 문맥 재사용을 함께 지원한다. 캐시를 보존하려면 실제 동작을 바꾸는 방식뿐 아니라 요청 구조를 유지하는 방식도 고려해야 한다.
  • 고객 사례는 적중률 상승이 비용 절감으로 이어질 수 있음을 보여주지만, 신규 처리 토큰 비중·캐시 쓰기·평가 적중률·추론 비용은 서로 다른 지표이므로 각 결과를 구분해 해석해야 한다.

✅ 액션 아이템

  • Prompt Caching Dashboard에서 캐시 적중률 추이와 캐시·비캐시 입력 토큰 구성을 확인하고, 적중률 하락은 프롬프트 캐싱 진단 도구로 원인과 토큰 영향을 분석.
  • 명시적 캐시 분기점과 configuration_update의 적용 가능성을 검토하고, 도구 정의·스키마·순서를 유지하면서 allowed_tools 또는 tool_choice의 none 설정으로 도구 사용을 조절.
  • 30분 이내 공통 접두부 재사용과 프리워밍의 적용 가능성을 검토하고, 입력 비용 및 응답 지연의 개선 효과를 확인.

❓ 열린 질문

  • 반복되는 공통 접두부 중 30분 이내 재사용되어 캐시 할인 대상이 되는 비중은 어느 정도인가?
  • Prompt Caching Dashboard에서 적중률이 하락할 때 프롬프트 캐싱 진단 도구가 식별하는 주요 변경 원인과 영향받은 토큰 수는 무엇인가?
  • 명시적 캐시 분기점·configuration_update·프리워밍을 적용할 때 캐시 적중률, 입력 비용, 응답 지연은 각각 얼마나 달라지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.