Articleopenai.com·2025년 4월 16일·2

Introducing OpenAI o3 and o4-mini

Quick Summary

오픈AI o3와 o4 mini는 강화학습으로 추론 능력과 도구 선택 능력을 함께 확장해, 복잡한 문제를 분석하고 웹 검색·파일 처리·파이썬·이미지 생성 등 여러 도구를 연계해 해결하는 모델이다.

Introducing OpenAI o3 and o4-mini 관련 대표 이미지

🖼️ 인포그래픽

Introducing OpenAI o3 and o4-mini 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing OpenAI o3 and o4-mini의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing OpenAI o3 and o4-mini 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

오픈AI o3와 o4-mini는 강화학습으로 추론 능력과 도구 선택 능력을 함께 확장해, 복잡한 문제를 분석하고 웹 검색·파일 처리·파이썬·이미지 생성 등 여러 도구를 연계해 해결하는 모델이다.

📌 핵심 요약

  • o3는 코딩·수학·과학·시각 인식에서 높은 성능을 보이는 강력한 추론 모델로, 외부 전문가 평가에서 어려운 실제 과제의 중대한 오류를 o1보다 20% 적게 기록했다.
  • o4-mini는 빠르고 비용 효율적인 추론에 최적화됐으며, 수학·코딩·시각 과제뿐 아니라 비이공계 과제와 데이터 과학에서도 이전 모델인 o3-mini를 앞섰다.
  • 두 모델은 웹 검색, 업로드 파일 및 데이터 분석, 파이썬 실행, 이미지 이해와 생성 등 ChatGPT의 도구를 상황에 맞게 선택하고 여러 단계로 결합할 수 있다.
  • 이미지를 단순히 인식하는 데 그치지 않고 추론 과정에 직접 통합하며, 흐리거나 뒤집힌 이미지도 해석하고 필요하면 회전·확대·변환해 문제를 해결한다.
  • 오픈AI는 생물학적 위협·악성코드·탈옥 공격 관련 안전 학습 자료와 시스템 차원의 감시 장치를 강화했으며, 평가 결과 두 모델 모두 준비태세 프레임워크의 고위험 기준보다 낮은 수준으로 판정됐다.

🧩 주요 포인트

  1. o3는 코딩·수학·과학·시각 인식에서 높은 성능을 보이는 강력한 추론 모델로, 외부 전문가 평가에서 어려운 실제 과제의 중대한 오류를 o1보다 20% 적게 기록했다.
  2. o4-mini는 빠르고 비용 효율적인 추론에 최적화됐으며, 수학·코딩·시각 과제뿐 아니라 비이공계 과제와 데이터 과학에서도 이전 모델인 o3-mini를 앞섰다.
  3. 두 모델은 웹 검색, 업로드 파일 및 데이터 분석, 파이썬 실행, 이미지 이해와 생성 등 ChatGPT의 도구를 상황에 맞게 선택하고 여러 단계로 결합할 수 있다.
  4. 이미지를 단순히 인식하는 데 그치지 않고 추론 과정에 직접 통합하며, 흐리거나 뒤집힌 이미지도 해석하고 필요하면 회전·확대·변환해 문제를 해결한다.
  5. 오픈AI는 생물학적 위협·악성코드·탈옥 공격 관련 안전 학습 자료와 시스템 차원의 감시 장치를 강화했으며, 평가 결과 두 모델 모두 준비태세 프레임워크의 고위험 기준보다 낮은 수준으로 판정됐다.

🧠 상세 정리

1. 추론과 전체 도구 접근의 결합

오픈AI는 o3와 o4-mini를 응답 전에 더 오래 생각하도록 훈련한 새로운 o 시리즈 모델로 소개하며, 당시까지 공개한 모델 가운데 가장 높은 수준의 지능과 실용성을 갖췄다고 설명한다. 가장 큰 변화는 추론 모델이 처음으로 ChatGPT 안의 웹 검색, 업로드 파일 및 데이터의 파이썬 분석, 시각 입력 해석, 이미지 생성 등 모든 도구를 주도적으로 선택하고 결합할 수 있게 됐다는 점이다. 두 모델은 단순히 도구 사용법만 학습한 것이 아니라, 원하는 결과에 따라 언제 어떤 도구를 써야 하는지 판단하도록 훈련됐으며 일반적으로 1분 이내에 적절한 형식의 상세한 답을 만드는 것을 목표로 한다. 이 능력은 여러 논점과 작업 단계가 얽힌 질문을 더 효과적으로 처리하고, 사용자를 대신해 과업을 독립적으로 수행하는 방향으로 ChatGPT를 발전시키기 위한 기반으로 제시된다.

2. o3의 복합 추론 성능

o3는 코딩, 수학, 과학, 시각 인식 등 다양한 영역의 경계를 확장하는 가장 강력한 추론 모델로 소개됐다. Codeforces, 별도의 모델 전용 맞춤형 실행 구조 없이 평가한 SWE-bench, 그리고 다중 분야·다중 양식 이해를 측정하는 MMMU 등에서 새로운 최고 수준의 결과를 기록했으며, 답이 즉시 드러나지 않는 복합적인 분석 과제에 적합하다고 설명된다. 특히 이미지, 차트, 그래픽을 분석하는 시각 과제에서 강점을 보였고, 외부 전문가 평가에서는 어려운 실제 업무에서 발생한 중대한 오류가 o1보다 20% 적었다. 프로그래밍, 비즈니스·컨설팅, 창의적 아이디어 발상에서 두드러진 평가를 받았으며, 초기 사용자는 생물학·수학·공학 분야에서 새로운 가설을 만들고 비판적으로 검토하는 사고 파트너로서의 분석적 엄밀성을 강조했다.

3. o4-mini의 효율성과 높은 처리량

o4-mini는 크기와 비용을 줄이면서도 빠르고 효율적인 추론을 제공하도록 최적화된 모델로, 특히 수학·코딩·시각 과제에서 높은 성능을 보였다. AIME 2024와 2025 벤치마크에서 가장 좋은 성적을 기록한 모델로 소개됐으며, 파이썬 인터프리터를 사용할 수 있는 AIME 2025 평가에서는 99.5%의 단일 시도 통과율과 여덟 번의 결과를 종합했을 때 100%의 합의 성과를 기록했다. 다만 원문은 컴퓨터 접근이 시험 난도를 크게 낮추므로 이 수치를 도구를 사용하지 않은 모델의 성능과 직접 비교해서는 안 된다고 명시한다. 전문가 평가에서 o4-mini는 비이공계 과제와 데이터 과학에서도 o3-mini보다 우수했으며, 효율성이 높아 o3보다 훨씬 높은 사용 한도를 지원하므로 추론이 필요한 대량·고처리량 작업의 선택지로 제시된다.

4. 지시 준수와 자연스러운 상호작용

외부 전문가들은 o3와 o4-mini 모두 이전 모델보다 지시를 더 잘 따르고, 더 유용하면서도 검증 가능한 답을 제공한다고 평가했다. 이러한 개선에는 모델 자체의 지능 향상뿐 아니라 웹 출처를 활용할 수 있다는 점이 함께 작용하며, 답변의 근거를 확인해야 하는 실제 과제에서 유용성을 높인다. 두 모델은 기존 추론 모델보다 대화가 더 자연스럽게 느껴지도록 설계됐고, 메모리와 과거 대화를 참조해 사용자에게 더 개인화되고 관련성 높은 답변을 제공한다고 설명된다. 벤치마크 성능에만 초점을 맞추지 않고, 지시 이행과 근거 제시, 대화의 자연스러움까지 함께 개선한 것이 실제 사용 환경에서의 변화로 강조된다.

5. 강화학습과 추론 시간의 확장

o3 개발 과정에서 오픈AI는 대규모 강화학습에서도 GPT 계열의 사전학습에서 관찰된 것과 같은 ‘연산량이 증가하면 성능이 향상된다’는 경향을 확인했다고 설명한다. 강화학습의 확장 경로를 다시 밟으면서 훈련 연산량과 응답 시점의 추론 연산량을 모두 한 자릿수 차수만큼 추가로 확대했으며, 그 이후에도 성능 향상이 계속 나타났다고 보고했다. o3는 o1과 동일한 지연 시간과 비용 조건에서도 ChatGPT에서 더 높은 성능을 냈고, 더 오래 생각하도록 허용하면 성능이 계속 상승하는 결과도 확인됐다. 두 모델의 도구 사용 역시 강화학습으로 훈련돼, 정해진 절차를 반복하는 수준을 넘어 목표와 진행 상황을 보고 도구 사용 여부와 순서를 판단하도록 발전했다.

6. 이미지를 활용하는 추론

o3와 o4-mini는 이미지를 단순한 입력 자료로 보는 데 그치지 않고, 시각 정보를 추론 과정에 직접 통합해 텍스트와 함께 사고할 수 있도록 설계됐다. 사용자는 화이트보드 사진, 교과서의 도표, 손으로 그린 스케치를 업로드할 수 있으며, 모델은 이미지가 흐리거나 뒤집혀 있거나 품질이 낮은 경우에도 내용을 해석할 수 있다. 필요한 경우 도구를 사용해 이미지를 회전하거나 확대하고 변환하면서 문제 해결에 필요한 정보를 찾아낸다. 이러한 시각·텍스트 결합 추론은 기존에 해결하기 어려웠던 문제를 다룰 수 있는 범위를 넓혔고, 다중 양식 벤치마크와 시각 인식 과제에서 높은 정확도로 이어졌다고 원문은 설명한다.

7. 여러 도구를 연결하는 에이전트형 작업

두 모델은 ChatGPT가 제공하는 전체 도구뿐 아니라 API의 함수 호출을 통해 사용자가 정의한 도구에도 접근할 수 있으며, 문제에 맞춰 여러 도구를 연속적으로 연결한다. 원문은 캘리포니아의 여름철 에너지 사용량이 전년과 어떻게 달라질지를 묻는 사례를 제시한다. 모델은 공공 전력 데이터를 웹에서 찾고, 파이썬 코드로 예측을 생성하며, 그래프나 이미지를 만든 뒤 전망을 좌우하는 핵심 요인을 설명하는 일련의 작업을 수행할 수 있다. 도중에 얻은 정보가 충분하지 않으면 검색 결과를 검토한 뒤 새로운 검색어로 다시 조사하는 등 방향을 바꿀 수 있으며, 이를 통해 최신 정보, 장시간 추론, 자료 종합, 다양한 형식의 결과 생성이 동시에 필요한 과제를 처리한다.

8. 비용 대비 성능의 개선

오픈AI는 o3와 o4-mini가 당시까지 공개한 모델 가운데 가장 지능적이면서도, 각각의 이전 모델인 o1과 o3-mini보다 여러 상황에서 더 효율적이라고 설명한다. 2025년 AIME 수학 경시대회 결과를 기준으로 보면 o3의 비용 대비 성능 경계는 o1보다 엄격하게 개선됐고, o4-mini 역시 o3-mini보다 더 나은 비용 대비 성능 경계를 보였다. 이는 같은 종류의 과제를 해결할 때 단순히 정확도만 높아진 것이 아니라, 투입 비용과 결과 품질의 관계도 개선됐다는 의미로 제시된다. 원문은 대부분의 실제 사용에서도 o3와 o4-mini가 각각 o1과 o3-mini보다 더 똑똑하면서 더 저렴할 것으로 기대하며, 특히 o4-mini의 효율성을 높은 사용 한도와 대량 처리의 근거로 연결한다.

9. 강화된 안전 학습과 위험 평가

오픈AI는 모델 능력이 향상되는 만큼 안전 조치도 강화해야 한다는 원칙에 따라 o3와 o4-mini의 안전 학습 자료를 전면 재구축했다. 생물학적 위협, 악성코드 생성, 탈옥 공격과 관련된 새로운 거부 학습 문항을 추가했으며, 두 모델은 지시 계층과 탈옥을 포함한 내부 거부 평가에서 높은 성능을 기록했다. 위험한 요청을 시스템 차원에서 식별하기 위해 사람이 작성한 해석 가능한 안전 명세를 바탕으로 작동하는 추론 언어 모델 감시기도 개발했고, 생물학적 위험에 적용했을 때 사람 중심의 적대적 시험 대화 가운데 약 99%를 식별했다. 준비태세 프레임워크에 따라 생물·화학, 사이버보안, 인공지능 자기 개선의 세 영역을 평가한 결과, 두 모델 모두 모든 영역에서 고위험 기준보다 낮은 수준으로 판정됐으며 세부 결과는 별도의 시스템 카드에 공개됐다.

10. 코덱스 명령줄 도구와 제공 범위

오픈AI는 o3와 o4-mini의 추론 능력을 사용자의 컴퓨터와 연결하는 실험으로, 터미널에서 실행할 수 있는 가벼운 코딩 에이전트 코덱스 명령줄 도구를 함께 공개했다. 이 도구는 로컬 코드에 접근하면서 화면 캡처나 간단한 스케치를 모델에 전달할 수 있고, 완전한 오픈소스로 공개됐으며 관련 프로젝트에는 총 100만 달러 규모의 지원금이 2만 5천 달러 단위의 API 크레디트로 제공된다. 최초 발표 시점에는 ChatGPT Plus·Pro·Team 사용자의 모델 선택기에 o3, o4-mini, o4-mini-high가 추가돼 기존 모델을 대체했고, Enterprise·Edu 사용자는 일주일 뒤 접근할 수 있으며 무료 사용자는 작성 화면에서 ‘생각하기’를 선택해 o4-mini를 시험할 수 있다고 안내됐다. 개발자는 Chat Completions API와 Responses API에서 두 모델을 사용할 수 있고 일부는 조직 검증이 필요하며, Responses API에는 추론 요약과 함수 호출 주변의 추론 토큰 보존 기능이 언급된다. 또한 2025년 6월 10일 갱신 내용에 따르면 더 오래 생각해 신뢰도 높은 응답을 제공하도록 설계된 o3-pro가 ChatGPT Pro 사용자와 API에 제공되기 시작했다.

🧾 핵심 주장 / 시사점

  • 두 모델의 핵심 진전은 개별 벤치마크 점수만이 아니라, 문제를 분석한 뒤 필요한 도구를 선택하고 결과에 따라 검색과 계산 과정을 수정하는 에이전트형 추론에 있다.
  • o3는 복잡하고 정답이 바로 드러나지 않는 고난도 분석에, o4-mini는 비용과 처리량이 중요한 대규모 추론 작업에 각각 초점이 맞춰져 있다.
  • 성능 확장은 강화학습 연산량과 추론 시간을 늘리는 방식으로 이뤄졌으며, 오픈AI는 그와 동시에 거부 학습 자료, 위험 감시기, 준비태세 평가를 강화했다.

✅ 액션 아이템

  • o3와 o4-mini를 과제군(코딩·수학·과학·비이공계)별로 분할해 o1·o3-mini 대비 실사용 우선순위를 정한다.
  • 오류 20% 감소와 이미지 추론 통합 효과를 함께 측정해 각 모델의 적용 한계를 점검한다.
  • 웹검색·파일 데이터 분석·파이썬 실행·이미지 이해·생성 도구를 결합한 다단계 해결 경로를 명확히 정의한다.

❓ 열린 질문

  • o3의 중대한 오류 감소 20%가 실제 고난도 과제에서 가장 크게 드러나는 조건은 무엇인가?
  • o4-mini가 o3-mini 대비 성능 우위를 보이는 상황에서 비용 효율을 반영해 우선 사용 대상은 어디인가?
  • 생물학적 위협·악성코드·탈옥 대응 강화 후 고위험 기준 미만 판정이 배포 안전성에 충분한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.