ChatGPT Images 2.5 System Card - OpenAI Deployment Safety Hub
Quick Summary
ChatGPT Images 2.5는 이미지 생성·편집 성능과 다층 안전장치를 강화했으며, 적대적 평가에서 전반적으로 기존 모델과 동등하거나 나은 결과를 보였지만 유해 이미지 노출률 차이는 통계적으로 유의하지 않았다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
ChatGPT Images 2.5는 이미지 생성·편집 성능과 다층 안전장치를 강화했으며, 적대적 평가에서 전반적으로 기존 모델과 동등하거나 나은 결과를 보였지만 유해 이미지 노출률 차이는 통계적으로 유의하지 않았다.
📌 핵심 요약
- ChatGPT Images 2.5는 편집 시 세부 요소 보존과 결과 일관성, 인포그래픽 정확도·배치, 생성 속도를 개선하고 스케치 기반 생성·템플릿·공유 프롬프트를 제공한다.
- GPT-Image-2.5-Sunburst와 GPT-Image-2.5-Flare는 인터넷 공개 정보, 제휴로 확보한 정보, 사용자·인간 훈련자·연구자가 제공하거나 생성한 정보로 학습했다. 개인정보와 유해·민감 콘텐츠를 줄이는 필터링을 적용하며, 사실성 향상에 따른 딥페이크 위험에는 텍스트·이미지 단계의 안전장치로 대응한다.
- 안전 체계는 ChatGPT Images 2.0의 기반을 계승한다. 생성 전 LLM 기반 정책 검사와 입력·출력에 대한 안전 추론 모델의 검사를 통해 위반 요청이나 이미지를 차단하고, 실제 유해 결과 중심 평가와 온라인·오프라인 모니터링을 강화했다.
- 고정된 적대적 평가에서 유해 이미지 노출률은 GPT-Image-2.5-Sunburst 1.09%, GPT-Image-2.5-Flare 1.41%, ChatGPT Images 2.0 1.64%였다. 유해 이미지 노출률 차이는 통계적으로 유의하지 않았으며, 비폭력·폭력적 불법행위 범주에서는 각각 2.86%, 3.27%, 2.45%로 새 모델의 수치가 더 높았다. 이 평가는 실제 운영 트래픽의 발생 빈도를 나타내지 않는다.
- 두 모델 모두 Bio High와 Cyber High 임계값을 넘지 않았고, AI Self-Improvement 범주에서 의미 있는 위험을 제기한다는 증거도 없다고 설명한다. 그럼에도 생물학적 위험에는 High 역량 모델에 적합한 예방적 완화책을 적용하며, 이미지 입력·출력 차단기의 재현율과 정밀도는 유사한 텍스트 기반 시스템에 필적한다고 보고한다.
🧩 주요 포인트
- 편집 제어력과 사실성 향상 → 활용성 확대와 함께 딥페이크 위험이 커져 생성 전후를 연결하는 다층 안전장치가 중요해진다.
- 전체 유해 이미지 노출률의 수치상 하락과 비폭력·폭력적 불법행위 범주의 상승 → 평균 성능만으로 개선을 단정하기 어렵고, 통계적 유의성과 적대적 평가의 적용 범위를 함께 해석해야 한다.
- Bio High 미달에도 High 수준의 생물학적 위험 완화책 적용 → 측정된 역량과 예방적 보호 수준을 구분하는 접근이며, 입력·출력 차단 성능이 실제 보호의 핵심 근거가 된다.
🧠 상세 정리
1. 이미지 생성·편집 기능의 발전
원문은 ChatGPT Images 2.5를 이미지 생성 역량의 큰 진전으로 소개하며, 이미지 편집 결과의 일관성과 인포그래픽의 정확도·배치가 개선됐다고 설명한다. 사용자는 이미지의 배경 환경, 스타일, 구도를 바꾸면서 기존 세부 요소를 더 많이 유지할 수 있어, 변형 과정에서의 보존 능력이 주요 개선점으로 제시된다. 스케치 기반 생성, 템플릿, 공유 프롬프트는 생성 과정을 사용자가 더 세밀하게 제어하도록 돕는 기능이며, 빨라진 생성 속도는 제작과 반복 수정에 필요한 시간을 줄인다. 안전 체계는 ChatGPT Images 2.0과 같은 기반을 사용하되, 모델의 역량 향상으로 새롭게 나타나는 위험에 대응하기 위한 보호 장치를 추가하는 방향으로 설명된다.
2. 학습 데이터와 사실성 향상에 따른 위험
GPT-Image-2.5-Sunburst와 GPT-Image-2.5-Flare는 인터넷에 공개된 정보, 제삼자와의 제휴를 통해 접근한 정보, 사용자나 인간 훈련자·연구자가 제공하거나 생성한 정보를 포함하는 다양한 데이터로 학습했다. 데이터 처리 과정에는 품질 유지와 위험 완화를 위한 필터링이 포함되며, 개인정보를 줄이기 위한 고도화된 처리도 적용한다고 설명한다. 안전 분류기는 미성년자가 관련된 성적 콘텐츠를 비롯한 유해하거나 민감한 자료의 사용을 방지하거나 줄이는 역할을 한다. 한편 ChatGPT Images 2.5의 높아진 사실성은 보호 장치가 없을 경우 실제 인물·장소·사건을 소재로 정치적·성적 또는 기타 민감한 딥페이크를 더 설득력 있게 만들 수 있다. 원문은 이러한 이미지가 사용 정책을 위반한다고 밝히고, 사용자에게 전달되지 않도록 프롬프트와 이미지 양쪽에 보호 장치를 둔다고 설명한다.
3. 생성 전 거절과 입력·출력 차단
GPT-Image-2.5-Sunburst의 안전 체계는 생성 전 요청 검사, 입력 이미지 검사, 이미지와 프롬프트의 결합 분석, 최종 결과 검사로 이어지는 여러 층의 보호 장치로 구성된다. 상위 단계에서는 이미지 생성 모델에 요청을 보내기 전에 LLM 기반 정책 검사를 실행하고, 정책 위반으로 판단한 요청을 거절한다. 생성 시스템에 도달한 요청에는 프롬프트 의도와 콘텐츠 정책을 추론하도록 훈련된 안전 중심 멀티모달 모델을 감시자로 사용한다. 이 감시자는 도구에 제공되는 모든 텍스트와 이미지 입력을 검사하며, 위반 입력이 있다고 판단하면 생성을 차단한다. 생성된 이미지 역시 사용자에게 표시되기 전에 검사하므로, 입력 단계에서 걸러지지 않은 요청이라도 최종 결과가 정책을 위반하면 출력이 차단되는 구조다.
4. 안전 체계 개선과 평가 설계
이미지·텍스트 안전 분류기는 최초 GPT-4o 이미지 생성 출시 때부터 사용됐으며, 원문은 이후 안전 체계를 지속해서 개선해 왔다고 설명한다. 최근에는 수집한 피드백을 반영하는 추가 훈련으로 안전 추론 모델, 분류기, 정책과 전체 체계를 개선하고 온라인·오프라인 감시 및 집행을 강화했다. 평가 방식도 단순히 분류 체계에 일치하는지를 보는 접근에서 실제 서비스에서 유해한 출력이 나타나는 위험과 결과를 중심으로 보는 방향으로 전환했다. 미성년자 관련 고위험 범주에는 복수의 평가 체계를 운영하며, 두 모델의 종단 간 안전성은 폭력·성적 콘텐츠 등 추적 대상 범주 전반의 위반 이미지를 유도하도록 설계한 어려운 프롬프트로 자동 평가했다. 결과는 안전한 이미지 생성, 안전 체계에 의한 차단으로 이미지가 표시되지 않은 경우, 탐지되지 않아 위반 이미지가 표시될 경우로 나뉘며, 이 시험의 구성은 실제 운영 트래픽에서 그러한 요청이 얼마나 자주 발생하는지를 대표하지 않는다.
5. 전체 평가 결과와 통계적 해석의 한계
전체 평가에서 안전한 이미지 생성·차단·유해 이미지 노출 비율은 GPT-Image-2.5-Sunburst가 77.0%·21.9%·1.09%, GPT-Image-2.5-Flare가 79.4%·19.2%·1.41%, ChatGPT Images 2.0이 75.2%·23.1%·1.64%였다. 원문은 새 모델 계열이 대체로 기존 모델과 동등하거나 나은 성능을 보이며, 소폭 후퇴한 결과는 통계적으로 유의하지 않다고 해석한다. 표의 별표는 동일한 결과 유형과 정책 범주에서 기존 모델 대비 양측 정확 McNemar 검정의 p < 0.05를 뜻하며, 다중 비교 보정은 하지 않았다. 두 새 모델의 전체 안전 생성과 차단 비율에는 별표가 있지만, 유해 이미지 노출률의 차이는 어떤 비교에서도 이 유의성 기준을 충족하지 않았다. 자동 정책 라벨에는 오류가 있을 수 있고 범주별 표본 크기가 통계적 정밀도에 영향을 주므로, 결과는 평가에 사용한 고정 적대적 시험 집합과 모델·보호 장치 구성에 한정해 해석해야 한다.
6. 정책 범주별 성과와 후퇴 지점
유해 이미지 노출률을 GPT-Image-2.5-Sunburst, GPT-Image-2.5-Flare, ChatGPT Images 2.0 순으로 비교하면, 성적 콘텐츠는 0.52%·1.04%·2.07%였고 혐오는 세 모델 모두 0.36%였다. 폭력·유혈은 0.64%·1.93%·1.93%, 극단주의는 0.00%·0.00%·2.56%로, 개선의 크기와 양상은 범주 및 모델에 따라 달랐다. 자해는 1.13%·1.13%·1.51%, 정치적 콘텐츠는 0.35%·0.71%·1.06%, 학대는 1.69%·2.54%·2.54%였다. 반면 비폭력·폭력적 불법행위는 2.86%·3.27%·2.45%로 새 모델의 노출률이 기존 모델보다 높아 전체 평균의 방향과 달랐다. 기타 범주는 1.64%·1.53%·2.08%였으며, 종교적 인물과 풍자, 실제 인물을 조작하거나 불리하게 묘사한 이미지, 탈옥 시도, 이미지 기반 요청 같은 다양한 보호 대상을 포함한다. 이러한 범주별 수치 차이 역시 유해 이미지 노출률에 대한 통계적 유의성을 확보하지 못했으므로, 수치상의 개선이나 후퇴를 확정적인 성능 차이로 간주할 수는 없다.
7. Preparedness Framework 역량 평가
OpenAI의 Preparedness Framework는 심각한 피해의 새로운 위험을 만들 수 있는 첨단 역량을 생물학·화학, 사이버보안, AI Self-Improvement의 세 범주에서 추적하고 대비하도록 설계됐다. 원문은 이미지 모델이 AI Self-Improvement를 가능하게 하는 방식으로 코드를 생성하고 실행할 수 없다는 이유로, 두 모델이 이 범주에서 의미 있는 위험을 제기한다는 증거가 없다고 설명한다. 사이버와 생물학 역량은 기존 언어 모델 평가를 이미지 생성 방식에 맞춰 조정해 측정했다. 각 과제에서 모델이 눈에 보이는 추론 메모와 최종 답을 포함한 이미지를 만들도록 지시한 뒤, 이미지에 표현된 최종 답만 기존 채점 기준으로 평가했다. 이 방식은 같은 기초 질문에 대한 응답을 이미지라는 모델 고유의 출력 양식으로 평가하기 위한 것이며, 결과적으로 두 모델 모두 Bio High와 Cyber High 임계값을 넘지 않았다고 보고한다.
8. 생물학적 위험의 예방적 완화와 실시간 차단
OpenAI는 두 모델이 Bio High 임계값에 미달했음에도, GPT-Images 2.0 때와 마찬가지로 생물학적 위험 영역에서는 High 역량으로 취급하는 모델에 적합한 예방적 완화책을 적용한다고 설명한다. 이를 위해 기존 생물학적 위험 안전 정책을 이미지에 맞게 조정하고, 안전 추론 모델을 통해 모든 ChatGPT Images 2.5 입력과 출력에 적용한다. 실시간 감시자는 해당 정책을 위반한다고 판정한 출력을 차단하며, 편집용 이미지 입력에도 같은 차단 원칙을 적용해 위반 이미지가 탐지되면 생성을 중단한다. 감시 성능은 별도로 개발한 이미지 평가 집합으로 시험했으며, 재현율과 정밀도가 유사한 실시간 텍스트 기반 생물학적 위험 완화 시스템에 필적한다고 보고하지만 구체적인 수치는 제시하지 않는다. 제공된 본문은 오프라인 대화 검토·표시·차단에 관한 다음 절의 제목 일부에서 끊기므로, 그 절의 실제 운영 방식이나 추가 근거는 확인할 수 없다.
🧾 핵심 주장 / 시사점
- 안전한 생성과 차단은 모두 유해 이미지 노출을 막는 결과이므로, 차단 비율의 하락만으로 안전성이 약해졌다고 판단하기 어렵다. 전체 결과에서는 안전한 생성 비율이 높아졌지만 유해 이미지 노출률 차이의 유의성은 확보되지 않았다.
- 비폭력·폭력적 불법행위 범주의 수치상 후퇴는 전체 평균의 개선과 범주별 취약점이 동시에 존재할 수 있음을 보여준다. 다만 해당 차이도 통계적으로 유의한 후퇴로 입증된 것은 아니다.
- 생물학적 위험 대응은 역량 임계값을 넘었을 때만 보호를 강화하는 방식보다 예방적인 접근이다. 다만 차단 성능은 비교 가능한 수준이라는 서술만 있어, 제공된 본문만으로 정량적 효과를 세밀하게 판단하기는 어렵다.
✅ 액션 아이템
- ChatGPT Images 2.5의 편집 제어력·사실성 향상과 딥페이크 위험을 함께 고려해 활용 범위 검토.
- GPT-Image-2.5-Sunburst와 GPT-Image-2.5-Flare의 유해 이미지 노출률을 통계적 유의성 및 비폭력·폭력적 불법행위 범주의 결과와 함께 비교.
- Bio High 미달에도 적용한 생물학적 위험 완화책을 입력·출력 차단기의 재현율·정밀도 근거와 함께 검토.
❓ 열린 질문
- ChatGPT Images 2.5의 사실성 향상에 따른 딥페이크 위험을 텍스트·이미지 단계의 안전장치가 실제 운영에서 얼마나 줄이는가?
- 비폭력·폭력적 불법행위 범주에서 GPT-Image-2.5-Sunburst와 GPT-Image-2.5-Flare의 유해 이미지 노출률이 높게 나온 이유는 무엇인가?
- 생물학적 위험 입력·출력 차단기의 재현율과 정밀도가 유사한 텍스트 기반 시스템에 필적한다는 판단을 뒷받침하는 구체적인 수치는 무엇인가?