Articleopenai.com·2025년 4월 16일·1

Thinking with images

Quick Summary

OpenAI o3와 o4 mini는 이미지를 단순히 인식하는 데 그치지 않고, 확대·회전·자르기와 다른 도구를 활용해 시각 정보와 텍스트를 함께 추론하는 모델이다.

Thinking with images 관련 대표 이미지

🖼️ 인포그래픽

Thinking with images 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Thinking with images의 핵심 내용을 4단계로 요약한 인포그래픽
Thinking with images 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI o3와 o4-mini는 이미지를 단순히 인식하는 데 그치지 않고, 확대·회전·자르기와 다른 도구를 활용해 시각 정보와 텍스트를 함께 추론하는 모델이다.

📌 핵심 요약

  • OpenAI o3와 o4-mini는 답변 전에 더 오래 추론하며, 사용자가 올린 이미지를 내부 추론 과정에서 직접 변형하고 분석할 수 있다.
  • 모델은 별도의 전문 시각 모델에 의존하지 않고 이미지를 확대·회전·자르기·뒤집기·보정하면서 불완전하거나 방향이 잘못된 사진에서도 필요한 정보를 찾는다.
  • 경제학 문제 사진, 빌드 오류 화면, 손글씨 노트, 표지판, 버스 시간표처럼 시각 정보의 판독과 논리적 해석이 함께 필요한 작업에 활용할 수 있다.
  • Python 데이터 분석, 웹 검색, 이미지 생성 등의 도구와 연계해 미로 풀이처럼 여러 단계의 분석·검증·결과 표현이 필요한 복합 작업도 수행한다.
  • 이 방식은 시각 추론과 텍스트 추론을 결합하는 새로운 테스트 시점 연산 확장 방향을 제시하지만, 제공된 본문에는 구체적인 한계와 후속 계획의 상세 내용이 포함되어 있지 않다.

🧩 주요 포인트

  1. OpenAI o3와 o4-mini는 답변 전에 더 오래 추론하며, 사용자가 올린 이미지를 내부 추론 과정에서 직접 변형하고 분석할 수 있다.
  2. 모델은 별도의 전문 시각 모델에 의존하지 않고 이미지를 확대·회전·자르기·뒤집기·보정하면서 불완전하거나 방향이 잘못된 사진에서도 필요한 정보를 찾는다.
  3. 경제학 문제 사진, 빌드 오류 화면, 손글씨 노트, 표지판, 버스 시간표처럼 시각 정보의 판독과 논리적 해석이 함께 필요한 작업에 활용할 수 있다.
  4. Python 데이터 분석, 웹 검색, 이미지 생성 등의 도구와 연계해 미로 풀이처럼 여러 단계의 분석·검증·결과 표현이 필요한 복합 작업도 수행한다.
  5. 이 방식은 시각 추론과 텍스트 추론을 결합하는 새로운 테스트 시점 연산 확장 방향을 제시하지만, 제공된 본문에는 구체적인 한계와 후속 계획의 상세 내용이 포함되어 있지 않다.

🧠 상세 정리

1. 이미지를 보면서 생각하는 모델의 등장

OpenAI가 2025년 4월 16일 공개한 o3와 o4-mini의 핵심은 이미지를 단순한 입력 자료로 인식하는 수준을 넘어, 추론 과정 안에서 이미지 자체를 다룰 수 있다는 점이다. 앞선 o1처럼 두 모델도 답변하기 전에 더 오래 생각하고 긴 내부 추론 과정을 사용하지만, 여기에 시각 정보를 직접 탐색하고 변형하는 능력이 추가됐다. 따라서 모델은 먼저 이미지를 한 번 판독한 뒤 텍스트만으로 결론을 만드는 것이 아니라, 문제를 푸는 동안 필요한 부분을 다시 살펴보고 분석 방향을 조정할 수 있다. OpenAI는 이를 모델이 이미지를 단지 보는 것이 아니라 이미지와 함께 생각하는 변화로 설명하며, 멀티모달 추론의 중요한 진전으로 제시한다.

2. 확대·회전·자르기를 활용하는 시각 추론

o3와 o4-mini는 사용자가 업로드한 이미지에 확대, 회전, 자르기와 같은 간단한 이미지 처리 기법을 적용하면서 필요한 정보를 찾는다. 글자가 거꾸로 놓여 있으면 이미지를 돌리고, 작은 요소가 잘 보이지 않으면 해당 영역을 확대하며, 여러 정보가 한 장에 섞여 있으면 관련 부분만 잘라 집중적으로 분석할 수 있다. 이러한 처리는 별도의 전문 모델을 호출하는 부가 기능이 아니라 두 모델의 추론 능력에 기본적으로 결합되어 있다는 것이 본문의 강조점이다. 모델은 최초 화면에서 얻은 인상에 고정되지 않고, 시각적 조건에 맞춰 관찰 방식을 바꾸며 답을 구성한다. 그 결과 촬영 방향이나 구도, 해상도가 완벽하지 않은 이미지도 문제 해결의 실질적인 근거로 사용할 수 있다.

3. 불완전한 사진을 허용하는 사용자 경험

향상된 시각 지능은 사용자가 질문을 위해 사진을 정교하게 준비해야 하는 부담을 줄이는 데 초점을 둔다. 텍스트가 거꾸로 촬영됐거나 한 사진에 여러 개의 물리 문제가 포함되어 있어도, 모델이 방향과 영역을 스스로 조정해 관련 내용을 분석할 수 있다. 처음에는 분명하게 보이지 않는 대상도 확대를 통해 다시 확인할 수 있으므로, 사용자는 물체의 배치와 촬영 위치를 지나치게 걱정하지 않고 사진을 질문 수단으로 활용할 수 있다. 본문은 경제학 문제집 사진을 올려 단계별 설명을 받거나 빌드 오류 화면을 공유해 근본 원인을 분석받는 사례를 제시한다. 핵심은 이미지 판독과 고급 추론이 분리되지 않고 하나의 연속된 문제 해결 과정으로 작동한다는 데 있다.

4. 손글씨와 생활 정보 판독 사례

본문의 첫 번째 사례군은 손글씨 읽기, 문제 풀이, 표지판 확인, 버스 시간표 찾기처럼 일상적으로 접할 수 있는 시각 작업을 다룬다. 손글씨 노트 사례에서 모델은 먼저 파일을 불러와 내용을 살펴본 뒤, 글자가 거꾸로 있다는 사실을 발견하고 이미지를 회전해 읽기 쉬운 상태로 만든다. 이어서 필요한 부분을 확대하거나 아래쪽 영역을 잘라내고, 잘린 영역의 방향까지 다시 조정해 실제 질문과 관련된 내용을 확인한다. 이는 단순한 문자 인식 결과를 즉시 반환하는 방식이 아니라, 판독이 어려운 원인을 파악하고 적절한 이미지 조작을 선택하는 과정이다. 본문에 제시된 이러한 예시는 모두 OpenAI o3로 수행됐으며, 관찰과 조작, 해석이 반복되는 시각 추론의 작동 방식을 보여준다.

5. 다른 도구와 결합한 멀티모달 에이전트 경험

시각 추론 모델은 이미지 조작에만 머무르지 않고 Python 데이터 분석, 웹 검색, 이미지 생성과 같은 다른 도구와 함께 복잡한 문제를 해결하도록 설계됐다. 모델은 이미지에서 필요한 정보를 찾은 뒤 계산이나 구조 분석이 필요하면 Python을 사용하고, 외부 정보 확인이 필요하면 웹 검색을 결합하며, 결과를 시각적으로 표현해야 할 때는 이미지 생성 기능을 활용할 수 있다. 본문은 이러한 연계를 OpenAI가 사용자에게 제공하는 첫 번째 멀티모달 에이전트 경험으로 설명한다. 중요한 점은 도구들이 서로 분리된 기능 목록으로 작동하는 것이 아니라, 모델이 문제 해결 과정에서 어떤 도구가 필요한지를 판단하고 순차적으로 사용할 수 있다는 것이다. 이에 따라 하나의 요청 안에서 관찰, 계산, 검색, 검증, 결과 표현을 이어가는 작업이 가능해진다.

6. 미로 풀이에서 드러난 반복적 분석 과정

미로 풀이 사례는 시각 추론이 언제나 한 번의 정확한 판독으로 끝나는 것이 아니라, 가설과 검증을 반복하는 과정임을 구체적으로 보여준다. 모델은 미로 이미지의 검은 선과 투명 배경을 처음에는 일반적인 흑백 이미지처럼 처리하려 했지만, 픽셀 값과 실제 표시가 일치하지 않는 문제를 발견하고 알파 채널을 조사했다. 그 결과 검은 픽셀이 벽이고 투명한 영역이 통로라는 구조를 파악했으며, 이후 경계의 입구와 출구, 벽의 두께, 통로의 연결 상태를 분석하려 했다. 또한 임계값 처리, 벽 팽창, 형태학적 연산, 픽셀 단위 탐색, 너비 우선 탐색과 같은 여러 접근법을 검토하면서 어떤 방식이 통로를 막거나 외부 공간까지 연결할 수 있는지도 점검했다. 이 사례는 시각 정보의 표현 형식 자체를 진단하고 분석 전략을 수정하는 능력이 복합적인 이미지 문제 해결에서 중요하다는 점을 보여준다.

7. 시각과 텍스트를 결합한 연산 확장

OpenAI는 이미지 기반 추론을 테스트 시점 연산을 확장하는 새로운 축으로 설명한다. 기존의 긴 추론이 주로 텍스트와 논리적 단계의 전개에 초점을 맞췄다면, o3와 o4-mini는 문제를 푸는 동안 이미지의 특정 영역을 다시 관찰하고 변형하는 작업까지 연산 과정에 포함한다. 따라서 추가 연산은 단순히 더 긴 문장을 생성하는 데 사용되는 것이 아니라, 시각적 증거를 탐색하고 텍스트 추론과 연결하는 데 투입된다. 본문은 이러한 방식이 멀티모달 벤치마크에서 최첨단 성능으로 이어졌다고 밝히며, 첨부된 개요는 새 모델들이 시험된 멀티모달 작업에서 이전 모델보다 높은 성능을 보였다고 요약한다. 다만 제공된 자료에는 개별 벤치마크 이름과 점수, 모델별 수치 비교표가 포함되어 있지 않아 구체적인 성능 차이까지 확인할 수는 없다.

8. 현재 자료에서 확인되는 범위와 남은 설명

문서의 목차에는 시각 추론의 실제 작동, 벤치마크 성능, 한계와 향후 계획이 별도의 항목으로 제시되어 있다. 그러나 제공된 본문은 미로 분석 과정의 중간 부분에서 끝나므로, 한계와 다음 단계에 관한 구체적인 설명은 확인할 수 없다. 확인 가능한 범위에서는 방향이 틀어진 이미지, 작은 글자, 여러 문제가 섞인 사진, 투명 배경을 가진 미로처럼 까다로운 시각 조건을 모델이 도구와 반복 분석으로 처리한다는 점이 중심이다. 동시에 미로 사례에서는 초기 가정이 맞지 않아 픽셀과 알파 채널을 다시 조사하고 여러 처리 방법을 검토하는 모습도 나타나므로, 복잡한 이미지에서는 탐색과 수정이 필요한 과정임을 알 수 있다. 따라서 이 자료가 뒷받침하는 결론은 시각 추론 능력의 확대와 도구 결합의 가능성이며, 구체적인 실패 유형이나 향후 개선 일정에 대해서는 추가 본문 없이는 단정할 수 없다.

🧾 핵심 주장 / 시사점

  • 시각 추론의 핵심 변화는 이미지 인식 정확도만 높이는 것이 아니라, 문제 해결 중에 모델이 관찰 범위와 방향을 스스로 바꿀 수 있게 된 데 있다.
  • 미로 사례처럼 이미지의 투명도나 픽셀 구조가 일반적인 가정과 다를 때는 최초 판독보다 오류 발견, 표현 형식 진단, 분석 전략 수정이 더 중요한 역할을 한다.
  • 이미지 조작과 Python 분석, 웹 검색, 이미지 생성을 하나의 추론 흐름에서 연결하면 사진을 단순한 참고 자료가 아니라 계산·검증·행동의 출발점으로 사용할 수 있다.

✅ 액션 아이템

  • o3와 o4-mini가 답변 전에 더 오래 추론하는 환경에서 이미지 확대·회전·자르기·뒤집기·보정이 판독 정확도와 논리 추론 품질에 미치는 영향을 사례별로 검증한다.
  • 독립 시각 모델 없이 동작하는 특성을 전제로 Python 데이터 분석·웹 검색·이미지 생성 연계를 포함한 다단계 작업에서 시각-텍스트 결합 추론이 안정적으로 유지되는지 실증한다.
  • 경제학 문제 사진, 빌드 오류 화면, 손글씨 노트, 표지판, 버스 시간표 등 조합형 질의를 통해 o3·o4-mini의 활용 범위와 실패 패턴을 정량적으로 구분한다.

❓ 열린 질문

  • 불완전하거나 방향이 틀린 사진에서 내부 변형 처리 후 판독 정확도가 실제로 유의미하게 개선되는 조건은 무엇인가?
  • 경제학 문제·빌드 오류 화면·표지판·버스 시간표처럼 시각 판독과 논리 해석이 모두 필요한 작업에서 어떤 질의 유형이 가장 높은 이득을 보이고 어디서 한계가 드러나는가?
  • 제공된 본문에서 한계와 후속 계획이 비공개된 상태에서 이 테스트 시점 연산 확장의 실제 안정성 구간을 어떤 기준으로 판단할 것인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.