OpenAI o1 System Card
Quick Summary
OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
OpenAI o1 계열은 강화학습 기반의 숙고형 추론으로 안전 정책 준수와 탈옥 공격 저항성을 높였지만, 향상된 지능이 새로운 위험을 만들 수 있어 지속적인 정렬·스트레스 테스트·위험 관리가 필요하다.
📌 핵심 요약
- o1과 o1-mini는 답변 전에 사고 연쇄를 활용해 복잡한 문제를 추론하도록 훈련됐으며, 여러 전략을 시도하고 오류를 인식하면서 안전 정책을 문맥에 맞게 적용한다.
- 학습에는 공개 웹 자료와 오픈소스 데이터, 과학 문헌과 추론 자료, 제휴를 통해 확보한 비공개 전문 자료, 자체 구축 데이터가 사용됐고 개인정보 및 유해 콘텐츠를 줄이기 위한 필터링이 적용됐다.
- 평가는 유해 콘텐츠 생성, 정상 요청에 대한 과잉 거부, 탈옥 공격 저항성, 환각, 편향, 위험 역량, 사고 연쇄 관련 위험과 외부 레드팀 점검을 포괄하도록 설계됐다.
- 텍스트 평가에서 o1 계열은 대체로 GPT-4o와 동등하거나 더 좋은 결과를 보였으며, 특히 어려운 거부 평가와 탈옥 평가에서 뚜렷한 개선을 나타냈다.
- 다중모달 평가에서는 o1이 과잉 거부를 크게 줄였지만 안전 출력 지표는 GPT-4o보다 낮았으며, 보고서는 추론 능력의 안전상 이점과 잠재적 악용 위험을 함께 관리해야 한다고 강조한다.
🧩 주요 포인트
- o1과 o1-mini는 답변 전에 사고 연쇄를 활용해 복잡한 문제를 추론하도록 훈련됐으며, 여러 전략을 시도하고 오류를 인식하면서 안전 정책을 문맥에 맞게 적용한다.
- 학습에는 공개 웹 자료와 오픈소스 데이터, 과학 문헌과 추론 자료, 제휴를 통해 확보한 비공개 전문 자료, 자체 구축 데이터가 사용됐고 개인정보 및 유해 콘텐츠를 줄이기 위한 필터링이 적용됐다.
- 평가는 유해 콘텐츠 생성, 정상 요청에 대한 과잉 거부, 탈옥 공격 저항성, 환각, 편향, 위험 역량, 사고 연쇄 관련 위험과 외부 레드팀 점검을 포괄하도록 설계됐다.
- 텍스트 평가에서 o1 계열은 대체로 GPT-4o와 동등하거나 더 좋은 결과를 보였으며, 특히 어려운 거부 평가와 탈옥 평가에서 뚜렷한 개선을 나타냈다.
- 다중모달 평가에서는 o1이 과잉 거부를 크게 줄였지만 안전 출력 지표는 GPT-4o보다 낮았으며, 보고서는 추론 능력의 안전상 이점과 잠재적 악용 위험을 함께 관리해야 한다고 강조한다.
🧠 상세 정리
1. o1 시스템 카드의 목적과 핵심 문제의식
이 시스템 카드는 OpenAI o1과 o1-mini에 수행한 안전성 평가, 외부 레드팀 점검, 대비 프레임워크 평가를 설명한다. o1 계열은 대규모 강화학습을 통해 답변 전에 사고 연쇄를 사용하도록 훈련됐으며, 이런 숙고형 추론은 위험한 요청을 받았을 때 안전 정책을 문맥 속에서 검토할 수 있게 한다. 보고서는 불법적 조언 생성, 고정관념이 반영된 응답 선택, 알려진 탈옥 공격에 대한 취약성 등 일부 위험 평가에서 기존 주력 모델보다 개선된 성능을 제시한다. 동시에 더 높은 지능과 복잡한 추론은 위험한 응용의 기반이 될 수 있으므로, 강건한 정렬 방법과 광범위한 스트레스 테스트, 세밀한 위험 관리 절차가 함께 필요하다고 밝힌다. 점수표 기준상 완화 이후 위험이 중간 이하인 모델만 배포할 수 있고, 높음 이하인 모델만 추가 개발할 수 있다.
2. 숙고형 추론 모델의 구조와 안전상 의미
o1 계열은 빠르고 직관적으로 응답하는 방식에 더해, 답변 전에 오래 숙고하는 추론 방식을 사용하도록 설계됐다. OpenAI o1은 이전에 o1-preview로 불렸던 계열의 후속 모델이며, o1-mini는 더 빠르게 작동하면서 특히 코딩에 효과적인 버전으로 소개된다. 훈련 과정에서 모델은 사고 절차를 다듬고, 서로 다른 해결 전략을 시도하며, 자신의 실수를 인식하는 방법을 학습한다. 이러한 추론은 단순한 거부 규칙을 기계적으로 적용하는 데 그치지 않고, 주어진 상황에서 세부 지침과 모델 정책을 검토해 안전 기대에 부합하는 행동을 선택하도록 돕는다. 그 결과 유용한 정상 답변을 제공하면서도 안전 규칙을 우회하려는 시도와 부적절하거나 위험한 콘텐츠 생성에 더 잘 저항하는 것이 목표다.
3. 학습 데이터의 구성과 유해 정보 완화
o1과 o1-mini의 사전학습에는 공개 데이터, 데이터 제휴로 접근한 독점 자료, 내부에서 개발한 맞춤형 데이터가 함께 사용됐다. 공개 데이터에는 웹 자료와 오픈소스 데이터셋뿐 아니라 추론 자료와 과학 문헌이 포함돼 일반 지식과 기술 주제에 대한 복잡한 추론 능력을 뒷받침한다. 제휴 데이터에는 유료 콘텐츠, 전문 아카이브, 특정 분야의 비공개 데이터처럼 산업별 지식과 활용 사례를 보강하는 자료가 포함됐다. 데이터 처리 과정에서는 품질을 유지하고 잠재적 위험을 줄이기 위한 엄격한 필터링이 적용됐으며, 학습 데이터에 포함된 개인정보를 줄이는 절차도 사용됐다. 또한 유해하거나 민감한 콘텐츠와 아동 성착취물 같은 명시적 위험 자료의 사용을 막기 위해 콘텐츠 조정 인터페이스와 안전 분류기를 함께 활용했다고 설명한다.
4. 평가 대상 체크포인트와 시험 범위
보고서의 평가는 o1 계열 전체를 대상으로 하지만 실제 운영 모델의 수치는 시스템 업데이트, 최종 매개변수, 시스템 지침과 기타 조건에 따라 조금 달라질 수 있다. 구체적으로는 출시 직전 체크포인트와 12월 5일 출시 체크포인트가 평가에 사용됐으며, 두 시점 사이에는 기본 모델을 유지한 채 출력 형식 준수와 지시 이행을 개선하는 점진적 후속 훈련이 적용됐다. 일반 안전성 평가와 사고 연쇄 안전성 평가, 다국어 평가는 12월 5일 출시 체크포인트에서 수행됐다. 외부 레드팀과 대비 프레임워크 평가는 출시 직전 체크포인트를 대상으로 진행됐고, 기존 선도 모델 평가 결과도 후속 개선에 적용할 수 있다고 판단했다. 미국과 영국의 인공지능 안전 기관도 배포 전 평가를 수행했지만, 그 결과는 이 보고서에 포함되지 않았다.
5. 유해 콘텐츠 거부와 과잉 거부 평가
보고서는 GPT-4o와 o1 계열을 비교해 혐오 콘텐츠, 범죄 조언, 의료·법률 같은 규제 분야의 부적절한 조언을 모델이 생성하지 않는지 평가했다. 동시에 폭탄 관련 문장을 번역하라는 요청이나 파이썬 프로세스를 종료하는 방법처럼 위험한 단어가 포함됐지만 의도는 정상적인 요청을 잘못 거부하지 않는지도 측정했다. 평가에는 표준 거부 시험, 더 어려운 도전형 거부 시험, 공개 대화 자료에서 추출한 유해 대화, 과잉 거부의 경계 사례를 다루는 시험이 사용됐다. 자동 채점기는 출력이 정책상 안전한지를 나타내는 지표와 정상 요청에 응답했는지를 나타내는 지표를 중심으로 결과를 판정했다. 텍스트 평가에서 o1 계열은 전반적으로 GPT-4o와 비슷하거나 더 나았으며, 도전형 거부 시험의 안전 지표는 GPT-4o의 0.713에서 o1의 0.92로 향상됐다.
6. 텍스트와 이미지를 결합한 다중모달 평가
o1은 텍스트와 이미지를 함께 입력하는 다중모달 환경에서도 금지 콘텐츠를 적절히 거부하고 정상 요청에는 응답하는지 평가받았다. o1-preview와 o1-mini는 이미지를 직접 입력받을 수 없기 때문에 이 비교에서 제외됐고, GPT-4o와 o1만 평가 대상이 됐다. 안전하지 않은 출력을 내지 않는 지표는 GPT-4o가 0.99, o1이 0.96으로 나타나 o1이 이 항목에서 더 낮았다. 반면 정상적인 요청을 과도하게 거부하지 않는 지표는 GPT-4o의 0.48에서 o1의 0.96으로 크게 높아졌다. 보고서는 이 결과를 통해 현재 o1이 다중모달 입력에서 과잉 거부를 줄였다고 설명하면서도, 안전 훈련을 통해 정확한 거부 경계를 설정하는 일은 계속 해결해야 할 과제라고 명시한다.
7. 탈옥 공격에 대한 강건성 검증
탈옥 평가는 모델이 원래 생성해서는 안 되는 콘텐츠를 내놓도록 거부 체계를 우회하는 적대적 지시에 얼마나 잘 저항하는지 측정했다. 시험에는 실제 서비스 데이터에서 확인된 탈옥 사례, 표준 금지 콘텐츠 요청에 공개 탈옥 기법을 결합한 사례, 사람 중심의 레드팀에서 수집한 공격, 학술 문헌의 일반적인 공격을 다루는 StrongReject가 포함됐다. StrongReject에서는 각 요청에 적용된 탈옥 기법 중 효과가 강한 상위 10퍼센트를 기준으로 모델의 안전성을 계산했다. 비교 대상은 o1, o1-preview, o1-mini와 GPT-4o였으며, 보고서는 모든 탈옥 평가에서 o1 계열이 GPT-4o보다 유의미하게 개선됐다고 설명한다. 특히 난도가 높은 StrongReject 평가에서 개선이 두드러져, 숙고형 추론과 정책 적용이 알려진 우회 공격에 대한 저항성을 높였다는 결과를 제시한다.
8. 추론 능력의 양면성과 지속적인 위험 관리
o1의 문맥 추론 능력은 모델이 안전 정책을 더 정확하게 집행하고 어려운 탈옥 공격에 저항할 수 있는 새로운 수단을 제공한다. 보고서는 o1 계열을 당시 OpenAI 모델 가운데 가장 강건한 모델로 평가하며, 내부의 어려운 콘텐츠 정책 준수 시험에서도 높은 성능을 기록했다고 밝힌다. 그러나 같은 추론 능력이 위험한 응용에 활용될 수 있다는 점도 분명히 인정하고, 유해성·탈옥·환각·편향·위험 역량뿐 아니라 사고 연쇄 자체에서 발생하는 위험과 기만 탐지 연구까지 점검 범위에 포함한다. 안전 작업은 유해 요청에 대한 거부 행동 훈련, 심각한 콘텐츠를 걸러내는 조정 모델, 공개 및 내부 평가, 이전 모델에서 축적한 외부 레드팀 방식을 토대로 구성됐다. 따라서 이 시스템 카드가 제시하는 핵심 결론은 높은 추론 성능만으로 안전이 자동 보장되는 것이 아니라, 정렬 방법의 강화와 반복 평가, 외부 전문가의 검증, 배포 전후의 엄격한 위험 관리가 계속 병행돼야 한다는 것이다.
🧾 핵심 주장 / 시사점
- o1의 안전성 개선은 단순한 답변 거부 확대가 아니라, 위험 요청은 거부하면서 정상 요청에는 응답하도록 거부 경계를 정교화한 결과로 나타난다.
- 텍스트와 탈옥 평가에서는 o1 계열의 개선이 확인됐지만, 다중모달 안전 출력 지표처럼 GPT-4o보다 낮은 항목도 있어 평가 유형별 결과를 분리해 판단해야 한다.
- 사고 연쇄 기반 추론은 안전 정책을 문맥에 맞게 적용하는 수단인 동시에 위험 역량을 높일 가능성도 있으므로, 모델 능력 향상과 별도로 지속적인 감시와 위험 완화가 요구된다.
✅ 액션 아이템
- o1·o1-mini의 사고 연쇄 추론이 안전 정책 문맥 적용을 어떻게 바꾸는지, 핵심 시나리오별로 정량화한다.
- 학습 데이터 출처(공개·오픈소스·과학 문헌·제휴·자체 구축)와 필터링 절차를 점검해 개인정보·유해 콘텐츠 유입 경로를 선제적으로 축소한다.
- 텍스트와 다중모달에서 과잉 거부, 탈옥 저항, 환각, 편향, 안전 출력 지표를 GPT-4o와 비교해 정렬·위험 균형의 우선순위를 조정한다.
❓ 열린 질문
- 텍스트 성능 향상과 다중모달 안전 하락을 동시에 고려할 때, 무엇이 허용 가능한 운영 기준이 될 수 있는가?
- 정렬·스트레스 테스트를 어떤 주기와 범위로 반복하면 사고 연쇄 기반의 신규 악용 위험을 조기에 탐지할 수 있는가?
- 레드팀 점검에서 드러난 취약점이 실제 악의적 활용으로 이어질 가능성은 어느 지표로 판단해야 하는가?