Articledeploymentsafety.openai.com·2026년 10월 7일·0

GPT-6 Sol and GPT-6 Luna: October 2026 update - OpenAI Deployment Safety Hub

Quick Summary

OpenAI는 ChatGPT에 GPT 6 Sol·Luna의 10월 버전을 출시하며 안전성과 유용성 개선을 보고했지만, 일부 성인·U18·이미지 안전 평가에서는 퇴행이 나타나 모델 평가와 시스템 차원의 보호 조치를 함께 해석해야 한다고 설명한다.

deploymentsafety.openai.comdeploymentsafety.openai.com원문 보기
GPT-6 Sol and GPT-6 Luna: October 2026 update - OpenAI Deployment Safety Hub 관련 대표 이미지

🖼️ 인포그래픽

GPT-6 Sol and GPT-6 Luna: October 2026 update - OpenAI Deployment Safety Hub 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

GPT-6 Sol and GPT-6 Luna: October 2026 update - OpenAI Deployment Safety Hub의 핵심 내용을 4단계로 요약한 인포그래픽
GPT-6 Sol and GPT-6 Luna: October 2026 update - OpenAI Deployment Safety Hub 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI는 ChatGPT에 GPT-6 Sol·Luna의 10월 버전을 출시하며 안전성과 유용성 개선을 보고했지만, 일부 성인·U18·이미지 안전 평가에서는 퇴행이 나타나 모델 평가와 시스템 차원의 보호 조치를 함께 해석해야 한다고 설명한다.

📌 핵심 요약

  • GPT-6는 전 세계 ChatGPT의 무료·유료 플랜에서 GPT-5.6 Sol과 GPT-5.6 Luna를 대체한다. Codex와 ChatGPT Work에서 사용하는 GPT-6 Sol·Luna는 기존 9월 버전이며, 이번 ChatGPT 출시 모델은 10월 버전으로 구분된다.
  • ChatGPT의 GPT-6는 Astra의 안전성 개선을 반영하고 사이버·생물학·폭력 관련 고위험 오용 방지 훈련을 강화했다. OpenAI는 GPT-5.6 대비 여러 턴에 걸쳐 적응하는 공격을 포함한 탈옥 저항성이 높아지고 부정직성·기만·안전장치 우회가 감소했으며, 정당한 요청에 대한 과도한 거부도 줄었다고 보고한다.
  • Preparedness Framework에서 GPT-6 Sol·Luna의 10월 버전은 Cybersecurity와 Biological and Chemical 영역의 High 역량으로 취급되지만, AI Self-Improvement의 High 기준에는 도달하지 않는다. GPT-5.6과 같은 보호 조치를 적용하며, 안전 평가는 최저 추론 설정에서, 역량 평가는 최대 추론 노력에서 수행한다.
  • 성인 대상 평가에서 GPT-6 Sol의 10월 버전은 표준 자해 항목, Luna는 표준 자해·잔혹한 묘사·성적 콘텐츠 항목에서 통계적으로 유의한 퇴행을 보였다. U18 평가에서는 두 모델 모두 연령 제한 콘텐츠·성적 콘텐츠·정서적 의존에서, Luna는 잔혹한 묘사에서도 유의한 퇴행을 보였으며, 이미지 입력 평가에서는 극단주의 항목의 퇴행이 보고됐다.
  • OpenAI는 검토한 위반 응답의 심각도가 대체로 낮았고 성인 대상 적대적 레드팀 평가에서도 평가 기준상 심각도가 높은 위험을 확인하지 못했다고 설명한다. 어려운 사례 중심의 평가 결과는 일반 사용의 발생률을 뜻하지 않으며, U18의 자해·성적 콘텐츠·잔혹한 묘사에 대한 추가 분류기 차단과 Trusted Contact·지역별 위기 상담 전화·Parental Controls 같은 시스템 보호 효과는 제시된 모델 평가에 반영되지 않는다.

🧩 주요 포인트

  1. ChatGPT의 10월 버전과 Codex·ChatGPT Work의 9월 버전 구분 → 같은 GPT-6 Sol·Luna 명칭만으로 출시 상태와 평가 결과를 동일시하기 어렵다.
  2. 탈옥 저항성과 정당한 요청의 유용성 개선, 일부 성인·U18 안전 항목의 퇴행 → 개선 여부는 개별 점수뿐 아니라 위반의 성격과 심각도를 함께 판단해야 한다.
  3. 최저 추론 설정의 안전 평가·최대 추론 노력의 역량 평가, 시스템 보호 효과의 미반영 → 평가 목적과 보호 계층을 구분해야 실제 배포 안전성을 해석할 수 있다.

🧠 상세 정리

1. ChatGPT 출시 범위와 버전 구분

OpenAI는 GPT-6를 전 세계 ChatGPT의 무료 및 유료 플랜 이용자에게 출시하며, 기존 GPT-5.6 Sol과 GPT-5.6 Luna를 대체한다고 설명한다. 다만 Codex와 ChatGPT Work에서 GPT-6 Sol 및 GPT-6 Luna를 사용하는 이용자는 이전에 출시된 버전을 계속 사용하므로, 시스템 카드에서는 이번 출시 모델을 10월 버전으로, 두 서비스에 남아 있는 모델을 9월 버전으로 구분한다. ChatGPT에 도입되는 GPT-6는 Astra의 안전성 개선을 반영하고, 실제 사용 사례에 맞춰 사이버·생물학·폭력 분야의 고위험 오용을 막는 안전 훈련을 강화했다. OpenAI는 안전성과 정렬 평가를 종합적으로 판단하면서 개선뿐 아니라 퇴행의 성격과 심각도도 함께 고려한다고 밝힌다. 이러한 종합 평가에서 GPT-5.6 대비 여러 턴에 걸쳐 적응하는 공격에 대한 탈옥 저항성이 강화됐고, 부정직성·기만·안전장치 우회가 감소했다고 보고한다.

2. 고위험 역량 분류와 평가 설정

Preparedness Framework에 따라 OpenAI는 GPT-6 Sol과 GPT-6 Luna의 10월 버전을 Cybersecurity 및 Biological and Chemical 영역에서 High 역량을 가진 모델로 취급한다. 반면 두 모델 모두 AI Self-Improvement 영역에서는 High 기준에 도달하지 않았다고 설명하며, 이 구분은 영역별 역량 평가에 따른 판단이다. 이 평가를 바탕으로 두 모델에는 GPT-5.6 System Card에서 GPT-5.6 Sol과 GPT-5.6 Luna에 대해 설명한 것과 동일한 보호 조치를 적용한다. 금지 콘텐츠와 정신 건강 등을 포함한 모든 안전 평가는 대다수 사용에서의 성능을 포착하기 위해 배포 시 최저 추론 설정에서 수행한다. 역량 평가는 모델이 보일 수 있는 능력의 상한을 확인하려는 목적이므로 최대 추론 노력에서 수행하며, 두 평가의 설정과 목적을 구분해 결과를 읽어야 한다.

3. 학습 방식과 이전 모델 비교의 한계

GPT-6 모델은 OpenAI의 다른 모델과 마찬가지로 다양한 데이터셋을 사용해 학습했으며, 개인정보를 줄이는 처리를 포함한 데이터 처리 파이프라인을 거쳤다. OpenAI의 추론 모델은 강화학습을 통해 답변 전에 생각하도록 훈련되며, 사용자에게 응답하기 전에 긴 내부 사고 과정을 생성할 수 있다고 설명된다. 학습 과정에서는 사고 과정을 다듬고 여러 전략을 시도하며 자신의 실수를 인식하는 방식을 익히고, 이러한 추론이 정해진 지침과 모델 정책을 따르는 데 도움을 준다는 것이 원문의 주장이다. 그 결과 더 유용한 답변을 제공하고 안전 규칙을 우회하려는 시도에도 더 잘 저항할 수 있다고 설명한다. 한편 과거 모델의 출시 당시 공개 수치는 그때 평가한 버전을 반영하지만, 이번 문서의 비교 수치는 이후 버전을 반영할 수 있으므로 출시 시점의 수치와 차이가 날 수 있다.

4. 어려운 실제 사례를 활용한 안전 평가

Production Benchmarks는 실제 서비스 데이터에서 도출한 까다로운 대화 사례를 대표하도록 구성됐으며, 이전 Standard 평가가 비교적 포화돼 지속적인 개선을 측정하기 어려워진 점을 보완하기 위해 도입됐다. 기존 모델이 아직 이상적인 답변을 내놓지 못했던 사례를 중심으로 의도적으로 어렵게 만들었기 때문에, 여기서 나타난 오류율을 일반적인 실제 사용의 평균 오류율로 해석해서는 안 된다. 주요 지표인 안전 응답률은 모델의 답변과 행동이 안전 정책상 금지되는지 확인하며, 모델 자체의 행동을 평가하기 위해 시스템 차원의 보호 조치를 제외한 상태에서 측정한다. OpenAI는 출시 후에도 해당 범주를 모니터링하고 실제 서비스 성능에 따라 보호 조치를 조정한다고 설명한다. 정책·채점기·데이터셋·평가 방식 등이 시간에 따라 바뀌므로, 이번 표에 포함되지 않은 과거 시스템 카드의 점수는 최신 결과와 일반적으로 직접 비교할 수 없다. 제공된 본문에는 표 제목과 범주 표시는 있지만 실제 점수는 없어, 항목별 수치 차이는 확인할 수 없다.

5. 성인 안전 평가의 퇴행과 과도한 거부 감소

각각의 GPT-5.6 대응 모델과 비교하면 GPT-6 Sol의 10월 버전은 표준 자해 평가에서, GPT-6 Luna의 10월 버전은 표준 자해·잔혹한 묘사·성적 콘텐츠 평가에서 통계적으로 유의한 퇴행을 보였다. OpenAI는 위반 응답을 수동 검토한 결과 정책 경계에 걸린 사례들이지만 전반적으로 안전한 편이었다고 판단했으며, 자해에 관한 정보성 질문에 답하면서 적절한 전문 지원 자원을 안내하는 경향이 늘었다고 설명한다. 평가상 자해 실행을 돕는 요청에는 응하지 않았고, 잔혹한 묘사와 성적 콘텐츠 요청에는 즉시 거부하기보다 응답하는 경우가 늘었지만 검토한 출력의 심각도는 낮았다고 보고한다. 추가 적대적 레드팀 평가에서도 자체 평가 기준에 따라 심각도가 높은 위험을 확인하지 못했다는 설명이 뒤따른다. 동시에 Safety Pareto 도표에서는 일부 안전 요청의 점수가 낮아졌지만 정당한 요청에 대한 유용성은 개선됐고, 무해한 요청을 거부하거나 과도하고 판단적인 주의 문구를 덧붙이는 경향도 줄었다고 제시한다. 이 모델 평가에는 Trusted Contact, 지역별 위기 상담 전화, 어린 이용자를 위한 Parental Controls 등 응답 전체의 안전성을 높이는 시스템 개입이 포함되지 않는다.

6. U18 정책과 청소년 대상 평가 결과

OpenAI는 AI가 청소년의 학습·창작·아이디어 탐색·정보 접근·새로운 기술 습득을 도울 수 있지만, 18세 미만 이용자에게 더 크거나 심각한 영향을 줄 수 있는 위험도 완화해야 한다고 설명한다. Model Spec의 청소년 관련 원칙은 18세 미만일 가능성이 있다고 판단되는 이용자를 위한 연령별 안전 정책으로 구현되며, 성적 콘텐츠·정서적 의존·섭식장애·연령 제한 상품과 서비스에서는 성인보다 엄격한 기준을 적용한다. 전용 U18 평가는 여섯 범주에서 연령에 맞는 경계를 일관되게 적용하는지 살피며, 실제 서비스에서 도출한 어려운 사례와 자해·섭식장애 관련 행동·연령 제한 상품이나 활동·잔혹한 묘사·부적절한 성적 콘텐츠에 관한 적대적 사례를 사용한다. GPT-5.6의 8월 대응 버전과 비교하면 GPT-6 Sol과 Luna의 10월 버전은 연령 제한 콘텐츠·성적 콘텐츠·정서적 의존에서 통계적으로 유의한 퇴행을 보였다. GPT-6 Luna의 10월 버전은 잔혹한 묘사에서도 유의한 퇴행을 보였으며, 나머지 차이는 통계적으로 유의하지 않았다고 명시한다.

7. U18 추가 차단과 정서적 의존 평가의 해석

청소년에게 금지된 응답이 제공될 위험을 줄이기 위해 OpenAI는 자해·성적 콘텐츠·잔혹한 묘사가 포함될 수 있는 응답에 추가 분류기 기반 차단을 적용한다. 이 보호 조치는 앞서 제시한 U18 평가 결과에는 반영되지 않았으며, 원문은 이를 적용하면 안전한 응답이 개선된다고 설명하지만 개선 폭에 대한 수치는 제공하지 않는다. 정서적 의존 항목의 퇴행을 검토한 결과, 평가가 모델의 무해한 별칭 사용에 지나치게 민감하게 반응한다는 문제도 확인했다고 밝힌다. 예를 들어 사용자가 명시적으로 요청한 경우의 'bro'나 'bestie' 같은 호칭은 금지된 행동으로 보지 않지만, 평가에서는 이러한 표현이 결과에 영향을 줄 수 있다는 설명이다. 또한 U18 평가는 어려운 사례와 드물게 나타나는 위험에 초점을 맞추므로, 결과를 일반적인 실제 서비스에서 해당 행동이 발생하는 빈도의 추정치로 읽어서는 안 된다. OpenAI는 더 안전하고 적절한 응답을 위한 훈련, 청소년 위험에 대한 이해, 연령에 맞는 보호 조치, 평가와 보고 방식의 개선을 계속하겠다고 밝힌다.

8. 이미지 입력 안전성과 탈옥 방어의 범위

이미지 입력 평가는 ChatGPT Agent에서 처음 도입한 시험을 사용하며, 텍스트와 이미지를 결합한 금지 요청에 대해 모델의 응답이 안전한 것으로 분류되는지를 측정한다. GPT-6 Sol과 Luna의 10월 버전은 각각 GPT-5.6 Sol과 Luna의 8월 버전과 대체로 비슷한 성능을 보였지만, 극단주의 이미지 평가에서는 퇴행이 나타났다. OpenAI는 이 평가의 안전하지 않은 응답을 검토했고 심각도가 대체로 낮았다고 설명하지만, 제공된 본문에는 실제 평가 점수가 포함되지 않는다. 이어지는 탈옥 항목은 거부 훈련을 우회해 유해한 도움을 끌어내려는 적대적 프롬프트에 대한 모델의 견고성을 다룬다. 여기서는 실제 서비스의 보호 조치 없이 주 모델을 직접 공격하므로 안전 체계의 한 계층만 측정하며, 실제 배포에는 유해한 도움을 얻기 어렵게 하는 분류기 등의 추가 보호 조치가 있다고 설명한다. 다만 제공된 본문은 이 설명 도중에 끊겨 있어, 뒤에 이어질 탈옥 평가의 구체적인 결과나 수치를 확인할 수 없다.

🧾 핵심 주장 / 시사점

  • 정당한 요청에 대한 유용성 향상과 일부 안전 항목의 퇴행이 함께 나타났다는 점은, 거부 감소 자체만으로 안전성 개선이나 악화를 단정하기 어렵다는 것을 보여준다.
  • 검토한 위반의 심각도가 대체로 낮았다는 OpenAI의 판단은 퇴행의 성격을 설명하지만, 통계적으로 유의한 퇴행이 있었다는 평가 결과를 없애지는 않는다.
  • 어려운 사례 중심의 모델 평가와 시스템 보호 조치를 포함한 실제 서비스는 측정 범위가 다르며, 제공된 본문에 표의 점수와 후속 탈옥 결과가 없어 개선·퇴행의 크기를 정량적으로 판단하는 데 한계가 있다.

✅ 액션 아이템

  • GPT-6 Sol·Luna의 평가를 적용할 때 ChatGPT의 10월 버전과 Codex·ChatGPT Work의 9월 버전 구분.
  • 성인·U18 안전 항목의 퇴행을 탈옥 저항성·정당한 요청의 유용성 개선 및 검토된 위반의 심각도와 함께 검토.
  • 최저 추론 설정의 안전 평가와 최대 추론 노력의 역량 평가를 구분하고, U18 추가 분류기 차단 등 시스템 보호 효과의 미반영을 고려.

❓ 열린 질문

  • ChatGPT의 10월 버전에서 보고된 GPT-6 Sol·Luna의 안전성 개선과 퇴행은 Codex·ChatGPT Work의 9월 버전과 비교하면 어떻게 다른가?
  • U18의 자해·성적 콘텐츠·잔혹한 묘사에 대한 추가 분류기 차단을 적용한 뒤 안전한 응답은 어느 정도 개선되는가?
  • 최저 추론 설정에서 평가한 GPT-6 Sol·Luna의 안전성은 최대 추론 노력에서는 어떻게 달라지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.