Articleopenai.com·2025년 9월 15일·3

Introducing upgrades to Codex

Quick Summary

오픈AI는 실제 소프트웨어 엔지니어링과 장시간 자율 작업에 최적화된 GPT‑5‑Codex를 공개하고, CLI·IDE·클라우드·GitHub를 연결하는 Codex 환경과 코드 리뷰·보안 기능을 강화했다.

Introducing upgrades to Codex 관련 대표 이미지

🖼️ 인포그래픽

Introducing upgrades to Codex 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Introducing upgrades to Codex의 핵심 내용을 4단계로 요약한 인포그래픽
Introducing upgrades to Codex 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

오픈AI는 실제 소프트웨어 엔지니어링과 장시간 자율 작업에 최적화된 GPT‑5‑Codex를 공개하고, CLI·IDE·클라우드·GitHub를 연결하는 Codex 환경과 코드 리뷰·보안 기능을 강화했다.

📌 핵심 요약

  • GPT‑5‑Codex는 프로젝트 구축, 기능 및 테스트 추가, 디버깅, 대규모 리팩터링, 코드 리뷰 등 실제 소프트웨어 엔지니어링 작업에 맞춰 GPT‑5를 추가 최적화한 모델이다.
  • 작고 명확한 요청에는 더 적은 토큰으로 빠르게 대응하고, 복잡한 작업에는 더 오래 추론·편집·테스트하며 필요에 따라 작업 시간을 동적으로 조절한다.
  • Codex CLI와 IDE 확장 프로그램은 이미지 입력, 할 일 추적, 웹 검색, MCP 연결, 개선된 변경사항 표시, 클라우드 작업 연계 등을 지원하도록 개편됐다.
  • Codex의 코드 리뷰는 PR의 의도와 실제 변경사항을 비교하고 코드베이스와 의존성을 탐색하며, 코드와 테스트를 실행해 중대한 결함을 찾는 데 초점을 둔다.
  • Codex는 기본적으로 네트워크가 차단된 샌드박스에서 실행되며, 위험한 명령에 대한 승인과 접근 범위 설정을 제공하지만 최종 검토와 배포 판단은 사람이 맡아야 한다.

🧩 주요 포인트

  1. GPT‑5‑Codex는 프로젝트 구축, 기능 및 테스트 추가, 디버깅, 대규모 리팩터링, 코드 리뷰 등 실제 소프트웨어 엔지니어링 작업에 맞춰 GPT‑5를 추가 최적화한 모델이다.
  2. 작고 명확한 요청에는 더 적은 토큰으로 빠르게 대응하고, 복잡한 작업에는 더 오래 추론·편집·테스트하며 필요에 따라 작업 시간을 동적으로 조절한다.
  3. Codex CLI와 IDE 확장 프로그램은 이미지 입력, 할 일 추적, 웹 검색, MCP 연결, 개선된 변경사항 표시, 클라우드 작업 연계 등을 지원하도록 개편됐다.
  4. Codex의 코드 리뷰는 PR의 의도와 실제 변경사항을 비교하고 코드베이스와 의존성을 탐색하며, 코드와 테스트를 실행해 중대한 결함을 찾는 데 초점을 둔다.
  5. Codex는 기본적으로 네트워크가 차단된 샌드박스에서 실행되며, 위험한 명령에 대한 승인과 접근 범위 설정을 제공하지만 최종 검토와 배포 판단은 사람이 맡아야 한다.

🧠 상세 정리

1. GPT‑5‑Codex 공개와 Codex의 통합

오픈AI는 GPT‑5를 Codex의 에이전트형 코딩 작업에 맞게 추가 최적화한 GPT‑5‑Codex를 공개했다. 이 모델은 짧은 대화형 작업뿐 아니라 길고 복잡한 업무를 독립적으로 수행하도록 설계됐으며, 클라우드 작업과 코드 리뷰의 기본 모델로 제공된다. 개발자는 Codex CLI와 IDE 확장 프로그램의 로컬 작업에서도 이 모델을 선택할 수 있다. 2025년 9월 23일 업데이트에 따르면 ChatGPT 구독뿐 아니라 API 키로 Codex를 사용하는 개발자도 이용할 수 있고, 가격은 GPT‑5와 같으며 Responses API에서만 제공된다. 모델의 기반 스냅샷은 정기적으로 갱신될 예정이다. Codex는 터미널, IDE, 웹, GitHub, ChatGPT iOS 앱으로 사용 범위를 넓혔고 ChatGPT Plus·Pro·Business·Edu·Enterprise 요금제에 포함된다.

2. 실제 소프트웨어 엔지니어링에 맞춘 훈련

GPT‑5‑Codex는 처음부터 전체 프로젝트를 구축하거나 기존 코드베이스에 기능과 테스트를 추가하는 작업을 비롯해 디버깅, 대규모 리팩터링, 코드 리뷰를 수행하도록 훈련됐다. 사용자의 지시로 방향을 조정하기 쉬워졌고 AGENTS.md에 작성된 지침을 더 잘 따르며, 코드 스타일이나 정리 기준을 장황하게 설명하지 않아도 높은 품질의 코드를 생성하는 것을 목표로 한다. 오픈AI는 과거 실행 환경의 제약 때문에 SWE-bench Verified의 500개 과제 가운데 477개 결과만 보고했지만, 문제를 수정한 뒤 전체 500개 과제를 기준으로 보고한다고 밝혔다. 별도의 리팩터링 평가는 Python, Go, OCaml로 작성된 대규모 기존 저장소의 실제 변경 유형을 포함한다. 제시된 사례 중 하나는 애플리케이션 로직 전체에 컨텍스트 변수를 전달하기 위해 232개 파일과 3,541개 줄을 변경한 Gitea 리팩터링이다.

3. 작업 복잡도에 따라 달라지는 추론과 실행

GPT‑5‑Codex는 모든 요청에 같은 양의 계산을 쓰는 대신 작업의 복잡도에 맞춰 생각하는 시간을 동적으로 조절한다. 작고 범위가 명확한 요청이나 개발자와 대화하며 진행하는 작업에는 빠르게 반응하고, 대규모 리팩터링처럼 복잡한 작업에는 더 오랫동안 추론·편집·테스트·반복을 수행한다. 테스트 과정에서는 복잡한 작업을 7시간 넘게 독립적으로 진행하면서 구현을 반복하고, 실패한 테스트를 수정한 끝에 성공적인 결과를 낸 사례도 관찰됐다. 오픈AI 직원 사용량에서 모델 생성 토큰이 가장 적은 하위 10%의 사용자 턴은 GPT‑5보다 토큰을 93.7% 적게 사용했다. 반대로 생성 토큰 기준 상위 10%의 복잡한 턴에서는 GPT‑5‑Codex가 추론과 코드 수정, 테스트 및 반복에 두 배의 시간을 사용했다.

4. 코드 리뷰와 프런트엔드 작업 능력

GPT‑5‑Codex는 코드 리뷰와 중대한 결함 탐지를 위해 별도로 훈련됐으며, 단순히 변경된 줄만 읽는 방식에 머물지 않는다. 리뷰할 때 코드베이스를 탐색하고 의존 관계를 추론하며, 실제 코드와 테스트를 실행해 변경의 정확성을 검증한다. 오픈AI는 인기 오픈소스 저장소의 최근 커밋을 대상으로 평가하고, 숙련된 소프트웨어 엔지니어에게 각 리뷰 의견의 정확성과 중요성을 판단하게 했다. 그 결과 GPT‑5‑Codex의 의견은 부정확하거나 중요하지 않을 가능성이 더 낮아 사용자가 중대한 문제에 주의를 집중하도록 돕는 것으로 나타났다. 프런트엔드 영역에서도 데스크톱 앱 제작과 모바일 웹사이트 생성에 대한 사람의 선호 평가가 개선됐으며, 클라우드에서는 입력된 이미지나 화면 캡처를 살펴보고 결과물을 시각적으로 점검한 뒤 작업 화면을 다시 보여줄 수 있다. 다만 범용 모델인 GPT‑5와 달리 GPT‑5‑Codex는 Codex 또는 그와 유사한 환경의 에이전트형 코딩 작업에 사용하는 것이 권장된다.

5. 에이전트형 작업에 맞게 개편된 Codex CLI

오픈소스로 제공되는 Codex CLI는 수개월 동안 수집한 커뮤니티 의견을 바탕으로 에이전트형 코딩 흐름에 맞게 다시 구축됐다. 사용자는 화면 캡처, 와이어프레임, 다이어그램 같은 이미지를 CLI에 직접 첨부해 디자인 의도와 문제 상황을 Codex와 공유할 수 있다. 복잡한 작업에서는 할 일 목록으로 진행 상황을 추적하며, 웹 검색과 외부 시스템 연결을 위한 MCP 도구도 사용할 수 있고 전반적인 도구 사용 정확도도 개선됐다. 터미널 화면에서는 도구 호출과 코드 차이가 더 읽기 쉬운 형식으로 표시되고, 긴 세션을 관리하기 위한 대화 상태 압축 기능도 지원된다. 승인 모드는 명시적 승인이 필요한 읽기 전용, 작업공간 내부에는 자동 접근하지만 외부 접근에는 승인이 필요한 자동 모드, 모든 위치의 파일과 네트워크 명령에 접근할 수 있는 전체 접근의 세 단계로 단순화됐다.

6. IDE와 클라우드를 잇는 개발 흐름

새 Codex IDE 확장 프로그램은 VS Code, Cursor 및 다른 VS Code 계열 편집기 안에 Codex 에이전트를 통합해 로컬 변경사항을 미리 보고 함께 코드를 편집하게 한다. Codex는 사용자가 열어 둔 파일과 선택한 코드를 문맥으로 활용하므로 더 짧은 요청으로도 빠르게 작업을 시작할 수 있다. 편집기 안에서 새 클라우드 작업을 만들고 진행 상태를 추적하며 완료된 결과를 검토할 수 있고, 클라우드 작업을 IDE로 열어 마무리할 때도 기존 문맥이 유지된다. 클라우드 인프라는 컨테이너 캐시를 통해 새 작업과 후속 작업의 완료 시간 중앙값을 90% 줄였으며, 일반적인 설정 스크립트를 찾아 실행해 작업 환경을 자동으로 구성한다. 인터넷 접근을 허용한 경우에는 실행 중에 필요한 의존성을 내려받는 명령도 사용할 수 있다. 또한 클라우드 Codex는 브라우저를 실행해 자신이 만든 화면을 확인하고 반복적으로 수정한 뒤 결과 화면을 작업이나 GitHub PR에 첨부할 수 있다.

7. GitHub에 통합된 자동 코드 리뷰

Codex의 코드 리뷰는 정적 분석과 달리 PR에 적힌 의도와 실제 코드 차이를 대조하고, 전체 코드베이스와 의존성을 고려해 동작을 판단한다. 필요한 경우 코드와 테스트를 직접 실행해 검증하므로 팀이 문제를 더 일찍 발견하고 사람 리뷰어의 부담을 줄이는 데 초점을 둔다. GitHub 저장소에서 기능을 활성화하면 PR이 초안 상태에서 검토 준비 상태로 바뀔 때 Codex가 자동으로 분석 결과를 게시하며, 수정이 필요하면 같은 대화에서 구현까지 요청할 수 있다. 사용자는 PR에서 ‘@codex review’를 언급해 명시적으로 리뷰를 요청하거나 보안 취약점과 오래된 의존성처럼 검토할 범위를 추가로 지정할 수 있다. 오픈AI 내부에서는 Codex가 대다수 PR을 검토하고 있으며, 사람의 검토가 시작되기 전에 발견되는 경우를 포함해 매일 수백 건의 문제를 찾아내고 있다고 설명한다. Cisco Meraki의 활용 사례에서는 다른 팀이 소유한 코드베이스의 리팩터링과 테스트 생성을 Codex에 맡겨 일정 지연과 위험 증가 없이 검증된 코드를 전달했다고 소개됐다.

8. 샌드박스 보안과 인간 검토의 원칙

오픈AI는 코드와 데이터의 외부 유출 및 도구 오용을 막는 것을 Codex의 핵심 설계 목표로 제시한다. Codex는 로컬과 클라우드 모두 기본적으로 네트워크 접근이 차단된 샌드박스에서 실행돼 컴퓨터에서 유해한 작업을 수행하거나 신뢰할 수 없는 출처의 프롬프트 주입에 노출될 위험을 줄인다. 잠재적으로 위험한 작업을 실행하기 전에는 사용자에게 권한을 요청할 수 있고, 결과를 검증하기 위해 명령을 실행하도록 훈련됐다. 개발자는 위험 허용 수준에 맞춰 보안 설정을 조정하고, 클라우드의 네트워크 접근을 신뢰하는 도메인으로 제한하거나 CLI와 IDE에서 전체 접근 명령, 웹 검색, MCP 연결을 개별적으로 허용할 수 있다. 각 작업에는 인용 정보, 터미널 기록, 테스트 결과가 제공되지만 오픈AI는 변경 적용이나 운영 환경 배포 전에 사람이 결과를 검토해야 한다고 강조한다. Codex의 코드 리뷰 역시 사람 리뷰를 대체하는 수단이 아니라 위험을 줄이기 위한 추가 리뷰어로 사용해야 하며, 생물학·화학 분야에서는 GPT‑5‑Codex를 높은 역량 수준으로 취급해 관련 보호 조치를 적용했다.

🧾 핵심 주장 / 시사점

  • GPT‑5‑Codex의 핵심 변화는 단순한 응답 속도 향상이 아니라, 작은 요청에는 계산을 줄이고 복잡한 작업에는 장시간 추론과 테스트를 투입하는 동적 실행 방식이다.
  • Codex는 CLI·IDE·클라우드·GitHub 사이에서 문맥과 작업을 이어 주고 이미지, 브라우저, 테스트 실행을 결합함으로써 코드 생성 도구보다 개발 흐름에 통합된 협업 에이전트에 가까워졌다.
  • 자동 코드 리뷰와 강력한 도구 접근은 검증 범위를 넓히지만, 기본 샌드박스와 단계별 승인, 네트워크 제한, 사람의 최종 검토를 함께 적용하는 것이 제품이 제시한 운영 원칙이다.

✅ 액션 아이템

  • GPT‑5‑Codex를 프로젝트 구축, 기능 추가, 디버깅, 대규모 리팩터링, 코드 리뷰에 단계적으로 투입할 범위를 정한다.
  • 작은 요청과 복잡한 요청을 구분해 토큰 사용량, 추론, 편집, 테스트 시간을 동적으로 조절하는 실행 규칙을 정의한다.
  • CLI·IDE의 이미지 입력, 웹 검색, MCP 연결, 변경사항 표시 개선, 클라우드 연동, 할 일 추적 기능을 코드 리뷰·개발 흐름에 맞춰 통합한다.

❓ 열린 질문

  • 네트워크 차단 샌드박스에서 위험 명령 승인 정책은 어떤 접근 범위와 로그/알림 규칙을 기본값으로 둘 때 통제가 유지되는가?
  • 코드 리뷰가 PR 의도 대비 실제 변경사항·의존성 탐색·테스트 실행을 함께 반영할 때 중대한 결함 판정의 실효 기준은 어디에서 정해야 하는가?
  • 장시간 자율 편집 후 최종 검토와 배포 판단은 사람이 어느 단계에서 개입해야 Codex의 효율성과 책임 경계가 균형을 이루는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.