ArticleOpenAI·2026년 9월 22일·0

Introducing GPT-6 Sol and Luna

Quick Summary

OpenAI는 GPT‑6 Astra의 주요 개선을 더 빠르고 저렴하게 제공하는 GPT‑6 Sol과 GPT‑6 Luna를 발표하며, 업무·코딩 성능 향상과 API 가격 인하, 캐싱 개선을 제시했다.

Introducing GPT-6 Sol and Luna 관련 대표 이미지

🖼️ 인포그래픽

Introducing GPT-6 Sol and Luna 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing GPT-6 Sol and Luna의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing GPT-6 Sol and Luna 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI는 GPT‑6 Astra의 주요 개선을 더 빠르고 저렴하게 제공하는 GPT‑6 Sol과 GPT‑6 Luna를 발표하며, 업무·코딩 성능 향상과 API 가격 인하, 캐싱 개선을 제시했다.

📌 핵심 요약

  • GPT‑6 Sol과 GPT‑6 Luna는 GPT‑6 Astra와 유사한 방식으로 훈련됐으며, Astra는 여전히 최상의 결과가 필요한 작업을 위한 최상위 모델로 제시된다. 100만 토큰당 입력·출력 가격은 Sol이 각각 $2·$10, Luna가 $0.10·$0.50이며, 원문은 GPT‑5.6 프로모션 가격 대비 API 가격을 50% 인하했다고 설명한다.
  • AutomationBench에서 GPT‑6 Sol(xhigh)은 33.2%와 작업당 $0.27을 기록해 Claude Opus 5(max)의 26.9%를 약 9%의 비용으로 웃돌았다. Agents’ Last Exam에서는 Sol(max)이 56.4%를 기록했으며, 내부 사실성 평가에서는 이전 모델보다 오류가 약 절반으로 줄었다.
  • DeepSWE v1.1에서 GPT‑6 Sol(max)은 68.8%로 Claude Fable 5(xhigh)의 69.9%에 근접하면서 작업당 비용은 약 80% 낮았다. GPT‑6 Luna(max)는 66.6%를 기록했으며, OSWorld 2.0 offline에서는 Sol(xhigh)이 60.5%로 Claude Opus 5(medium)의 60.3%와 비슷한 성능을 약 80% 낮은 비용으로 제공했다.
  • GPT‑6의 프롬프트 캐싱은 기본 적중률을 높이고 캐시된 입력 토큰 읽기에 90% 할인을 제공한다. 추론 노력과 도구 가용성을 변경해도 이전 문맥의 캐시 재사용이 유지되며, GitHub는 수십억 건의 요청에서 새 처리가 필요한 프롬프트 토큰 비중이 50% 넘게 줄었다고 보고했다.
  • GPT‑6 Sol과 GPT‑6 Luna는 더 명확하고 간결한 소통 방식과 정렬 개선을 도입했다. 발표 당일부터 ChatGPT Work와 Codex의 Plus·Pro·Business·Enterprise·Edu 사용자 및 API에 제공되며, Free·Go 사용자는 데스크톱 앱에서 Luna를 이용할 수 있지만 Chat에서는 아직 제공되지 않는다. 사실성·기만 평가는 일반적인 사용의 오류율을 나타내지 않으며, 연구·API 평가 결과는 실제 ChatGPT 출력과 다를 수 있다.

🧩 주요 포인트

  1. 모델별 가격·성능과 Astra의 최상위 지위 → 작업 난도와 예산에 따라 GPT‑6 Astra·GPT‑6 Sol·GPT‑6 Luna를 선택하는 구도가 확장된다.
  2. 업무·코딩·컴퓨터 사용 평가에서 낮아진 작업당 비용 → 반복 작업과 장시간 에이전트 활용의 경제성이 개선되지만, 비교할 때 추론 노력과 평가 조건을 함께 봐야 한다.
  3. 토큰 가격 인하와 캐시 재사용 개선 → 반복 문맥의 처리 비용과 응답 지연을 함께 낮출 수 있으며, 실제 활용 판단에는 제공 범위와 평가의 대표성 한계도 고려해야 한다.

🧠 상세 정리

1. GPT‑6 제품군 확장과 API 가격

OpenAI는 이달 앞서 공개한 GPT‑6 Astra를 가장 지능적이고 정렬된 모델로 소개하면서, 업무마다 규모·진행 속도·예산이 다르다는 점을 GPT‑6 Sol과 GPT‑6 Luna의 출시 배경으로 제시한다. 두 모델은 Astra와 유사한 방식으로 훈련돼 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬의 개선을 더 빠르고 저렴하게 제공하도록 설계됐다. 캐싱과 추론 인프라의 효율 향상으로 절감한 비용을 사용자에게 돌려준다며, GPT‑5.6 프로모션 가격 대비 API 가격을 50% 인하했다고 설명한다. 가격표의 100만 토큰당 입력·출력 요금은 Sol이 $4·$20에서 $2·$10으로, Luna가 $0.20·$1.20에서 $0.10·$0.50으로 바뀌며, Luna 출력 요금의 표기 수치는 일괄적인 50% 인하 설명과 정확히 일치하지 않는다. Astra는 계속해서 전반적으로 가장 우수한 모델로 제시되며, 가장 까다롭고 중요한 작업에서 최상의 결과를 원하는 경우의 선택지로 남는다.

2. 전문 업무에서의 성능과 작업당 비용

전문 업무에서는 GPT‑6 Sol이 높은 사용 한도와 낮은 비용으로 반복 작업의 여지를 넓히면서, 비슷한 가격대의 경쟁 모델보다 더 나은 결과를 제공한다고 설명한다. 영업·마케팅·운영·지원·재무·인사 영역의 47개 도구를 사용하는 AutomationBench 1.0.6에서 Sol(xhigh)은 33.2%, 작업당 $0.27을 기록해 Claude Opus 5(max)의 26.9%를 약 9%의 비용으로 넘어섰다. 같은 비교에서 GPT‑6 Astra(low)는 30.3%에 Sol의 3.9배 비용, Claude Fable 5.1과 Opus 5 대체 실행 조합(max)은 31.4%에 Sol의 8.9배를 초과하는 비용으로 제시된다. 다만 Fable 5.1의 공개 비용에는 약 40%의 작업에서 발생한 Opus 5 대체 실행 비용이 빠져 있어 실제 비용이 과소 표시됐다는 단서가 붙는다. GPT‑6 Luna(high)는 이전 모델보다 점수가 5.4%포인트 높고 작업당 비용은 58% 낮았으며, 별도의 Agents’ Last Exam에서 Sol(max)은 56.4%로 Claude Opus 5의 평가 내 최고 점수를 넘으면서 작업당 비용은 60% 낮았다.

3. 사실성 개선과 평가의 대표성 한계

OpenAI는 답변의 유용성이 사실의 정확성에 달려 있다는 전제 아래, GPT‑6 Sol과 GPT‑6 Luna의 사실적 신뢰성이 개선됐다고 설명한다. 내부 사실성 평가에서 Sol은 이전 모델보다 오류가 약 절반으로 줄어, 훨씬 낮은 비용으로 Astra 수준의 신뢰성에 가까워졌다고 제시된다. Luna도 크게 개선됐으며, 높은 추론 노력 수준에서는 GPT‑5.6 Sol과 비슷한 사실성을 약 100분의 1의 비용으로 달성한다고 주장한다. 이 평가는 사용자가 이전 모델의 사실 오류를 지적했던 실제 ChatGPT 대화를 비식별화해 구성한 것으로, 오류를 유발하는 사례에 집중돼 있으므로 일반적인 사용을 대표하지 않는다. 점수는 답변 길이를 통제하지 않았지만, 별도로 답변의 상세도를 바꿔 확인한 결과 길이에 따른 영향은 거의 없었다고 덧붙인다.

4. 코딩 에이전트의 장기 작업과 비용 효율

원문은 코딩 에이전트가 더 복잡하고 범위가 넓으며 오래 걸리는 작업을 맡게 되면서, 지속적인 사용 비용이 중요해졌다고 설명한다. OpenAI 내부 연구자의 일일 토큰 사용량을 API 가격으로 환산하면 중앙값 연구자는 $600, 90백분위 연구자는 $7,000을 넘었으며, 이는 실제 청구액이 아니라 사용 규모를 가격으로 환산한 수치다. 실제 코드베이스에 병합 가능한 변경을 평가하는 FrontierCode에서는 GPT‑6 Sol이 GPT‑5.6 Sol보다 크게 개선됐고, Claude Fable 5.1(xhigh)과 비슷한 성능을 훨씬 낮은 비용으로 달성한다고 제시한다. DeepSWE v1.1에서 Sol(max)은 68.8%로 Claude Fable 5(xhigh)의 최고 점수 69.9%와 1.1%포인트 차이였고, 작업당 비용은 약 80% 낮았다. Luna(max)는 66.6%로 Claude Opus 5와 Fable 5의 medium 설정에 견줄 만한 성능을 보였으며, 해당 비교에서 작업당 비용은 각각 93%와 96% 낮았다.

5. 컴퓨터 사용 성능과 측정 조건

컴퓨터 사용에서는 GPT‑6 Astra가 여전히 세계 최고 모델이라는 주장을 유지하면서, GPT‑6 Sol과 GPT‑6 Luna가 이전 모델보다 비용 효율적인 성능을 제공한다고 설명한다. OSWorld 2.0 offline에서 Sol(xhigh)은 60.5%를 기록해 Claude Opus 5(medium)의 60.3%와 비슷했으며, 작업당 비용은 약 80% 낮았다. Luna(max)는 GPT‑5.6 Sol(medium)을 웃도는 성능을 그 비용의 10분의 1로 달성했다고 제시된다. OSWorld 2.0은 일상 및 전문 업무에 걸친 장기적인 컴퓨터 사용 흐름을 평가하며, 원문이 보고하는 수치는 v2026.08.08 릴리스의 오프라인 평가 세트에서 측정한 부분 보상이다. 따라서 제시된 점수는 해당 평가 방식과 서로 다른 추론 노력 설정에 연결된 결과로 읽어야 하며, 모든 컴퓨터 작업에서 동일한 성능 차이가 발생한다는 의미로 확대할 수는 없다.

6. 기술 대화와 협업 방식의 변화

OpenAI는 Astra에서 개선한 소통 방식을 Sol과 Luna에도 적용했으며, 특히 기술 및 코딩 대화에서 차이가 두드러질 것으로 예상한다. 핵심 변화는 더 명확한 표현, 적은 전문용어와 어색한 문구, 가치가 낮은 세부사항의 축소이며, 내용의 충실함을 유지하면서 답변 전체는 조금 짧아지는 방향이다. 원문은 웹사이트에 Bento Box 디자인과 오른쪽 위 페이지 간 슬라이더를 추가하고 React를 살펴봐 달라는 요청을 GPT‑5.6 Sol과 GPT‑6 Sol의 비교 사례로 제시한다. 스타일 평가는 주관적임을 인정하면서도, GPT‑6 Sol이 성급하게 결론 내리지 않고 질문자가 이미 알 법한 정보의 반복과 모호한 표현을 줄였다는 점을 선호 이유로 든다. 또한 무엇을 확인했고 확인하지 않았는지를 더 솔직하게 알리고, 이미지 도구에 전달한 프롬프트처럼 불필요한 구현 세부사항을 공유하지 않는 점을 개선으로 설명한다.

7. 에이전트와 긴 대화를 위한 캐싱 개선

토큰 가격 인하와 함께 GPT‑6의 프롬프트 캐싱 기본 적중률을 높여, 에이전트가 더 많은 문맥을 재사용하고 더 빠르게 응답하며 캐시된 입력 토큰 읽기에 90% 할인을 받을 수 있도록 했다고 설명한다. 개발자는 Prompt Caching Dashboard에서 캐시된 입력의 양과 시간에 따른 변화를 확인하고, 진단 도구로 캐싱 기회를 놓친 이유와 수정할 부분을 파악할 수 있다. 대화 중 어려운 작업에 맞춰 추론 노력을 높이거나 간단한 후속 작업에서 낮추는 변경, 그리고 도구를 활성화하거나 비활성화하는 변경도 이전 문맥의 캐시 재사용을 유지한다. 명시적 중단점을 통해 캐시할 프롬프트 접두부의 끝을 지정할 수도 있어, 개발자가 재사용 범위를 더 직접적으로 제어할 수 있다. GitHub는 지난 몇 달간 이러한 개선으로 OpenAI 모델에 보낸 수십억 건의 요청에서 새 처리가 필요한 프롬프트 토큰의 비중이 50% 넘게 줄었고, Copilot의 응답 속도 향상에 도움이 됐다고 보고했다.

8. 정렬 개선과 기만 평가의 해석

GPT‑6 Sol과 GPT‑6 Luna는 OpenAI가 지금까지 가장 정렬된 모델로 소개한 Astra의 정렬 작업을 기반으로 한다. 두 모델은 정렬 평가에서 각각 GPT‑5.6의 대응 모델보다 개선됐으며, 코딩 작업에 관해 사용자를 오도하는 주장의 비율이 낮아진 점이 포함된다. 다만 원문은 이 평가들이 의도적으로 어려운 상황을 시험하므로, 일반적인 사용에서 발생하는 실패율을 측정한 것이 아니라고 명시한다. 내부 코딩 기만 평가에서는 부정직한 반응을 유발하도록 특별히 고른 작업을 에이전트에 부여했고, 추론 노력은 최대로 설정했다. 기만율은 답변에서 어떤 형태든 기만이 탐지된 경우의 비율을 뜻하며, 일반적인 사용에서는 기만이 훨씬 드물다는 설명과 함께 전체 결과는 시스템 카드에서 확인하도록 안내한다.

9. 제공 범위와 전체 평가의 비교 한계

GPT‑6 Sol과 GPT‑6 Luna는 발표 당일부터 ChatGPT Work와 Codex에서 Plus·Pro·Business·Enterprise·Edu 사용자에게 제공되며, OpenAI API에서는 각각 gpt-6-sol과 gpt-6-luna라는 이름으로 사용할 수 있다. Free와 Go 사용자는 데스크톱 앱에서 GPT‑6 Luna에 접근할 수 있지만, 두 모델은 아직 Chat에서는 제공되지 않는다고 구분한다. 서비스 안정을 위해 ChatGPT에서는 하루 동안 점진적으로 배포할 계획이므로, ChatGPT Work나 Codex에 새 모델이 보이지 않으면 나중에 다시 시도하도록 안내한다. GPT 평가는 연구 환경 또는 API에서 수행됐으며, 시스템 프롬프트와 사용 가능한 도구 등의 차이로 실제 서비스의 ChatGPT 출력과 약간 다를 수 있다. 경쟁 모델의 평가 수치는 공개 보고서에서 가져왔고, Claude Fable 5.1 점수가 없는 경우 Claude Fable 5의 점수를 사용했다는 점도 비교 해석의 조건으로 명시한다.

🧾 핵심 주장 / 시사점

  • 제시된 개선은 토큰 단가 인하뿐 아니라 일부 업무에서의 작업당 비용 감소와 캐시 재사용 확대를 함께 포함하므로, 장시간 에이전트 사용의 경제성을 여러 측면에서 높이려는 방향으로 읽힌다.
  • GPT‑6 Sol이 AutomationBench에서 낮은 추론 노력의 Astra를 앞선 결과는 특정 평가와 설정의 비교이며, Astra를 전반적인 최상위 모델로 유지하는 제품 구도와 구분해 해석해야 한다.
  • 사실성·정렬 개선의 방향은 제시되지만, 오류나 부정직성을 유발하도록 고른 평가 사례와 실제 서비스 환경의 차이 때문에 일반적인 사용의 오류율이나 성능을 그대로 추정하기는 어렵다.

✅ 액션 아이템

  • 작업 난도와 예산에 따라 GPT‑6 Astra·GPT‑6 Sol·GPT‑6 Luna의 선택 적합성을 비교 검토한다.
  • 업무·코딩·컴퓨터 사용의 작업당 비용을 비교할 때 추론 노력과 평가 조건을 함께 확인한다.
  • 반복 문맥을 사용하는 작업에서 캐시된 입력 토큰 읽기의 90% 할인과 캐시 재사용 유지가 실제 비용과 응답 지연에 미치는 영향을 검토한다.

❓ 열린 질문

  • 작업 난도와 예산이 달라질 때 GPT‑6 Astra·GPT‑6 Sol·GPT‑6 Luna를 선택하는 기준은 무엇인가?
  • 추론 노력과 평가 조건을 맞추면 업무·코딩·컴퓨터 사용에서 제시된 작업당 비용 차이는 어떻게 달라지는가?
  • 실제 ChatGPT 사용에서도 GPT‑6 Sol의 사실성 오류 감소와 GPT‑6 Sol·GPT‑6 Luna의 정렬 개선이 어느 정도 유지되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.