ArticleJaeho Lee·2026년 7월 7일·0

Contributions to OpenAI's Codex codebase show signs of AI uplift

Quick Summary

Epoch AI는 Codex 핵심 협업자 41명의 병합 PR을 분석해, AI 없이 24시간 이상 걸릴 것으로 추정된 산출물이 나온 협업자 근무일 비중이 2025년 2분기 2.0%에서 2026년 2분기 8.2%로 늘었지만 이는 인과적 생산성 측정이 아니라 시간 절감의 상한으로 해석해야 한다고 밝혔다.

Contributions to OpenAI's Codex codebase show signs of AI uplift 관련 대표 이미지

🖼️ 인포그래픽

Contributions to OpenAI's Codex codebase show signs of AI uplift 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Contributions to OpenAI's Codex codebase show signs of AI uplift 내용을 설명하는 본문 이미지

💡 한 줄 요약

Epoch AI는 Codex 핵심 협업자 41명의 병합 PR을 분석해, AI 없이 24시간 이상 걸릴 것으로 추정된 산출물이 나온 협업자 근무일 비중이 2025년 2분기 2.0%에서 2026년 2분기 8.2%로 늘었지만 이는 인과적 생산성 측정이 아니라 시간 절감의 상한으로 해석해야 한다고 밝혔다.

📌 핵심 요약

  • 분석 대상은 2025년 4월부터 2026년 6월까지 OpenAI의 공개 Codex 저장소에 병합된 PR 7,524건이며, 핵심 결과는 쓰기 권한이 확인된 공식 협업자 41명을 중심으로 산출됐다.
  • 각 PR을 경험 많은 개발자 한 명이 AI 없이 동일하게 구현하는 데 필요한 시간을 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro가 각각 추정했으며, 연구진은 세 값의 중앙값을 사용했다.
  • 24시간 이상으로 평가된 협업자 근무일은 2025년 2분기 2.0%에서 2026년 2분기 8.2%로 증가했고, 12시간 이상인 근무일도 14.9%에서 25.1%로 늘었다.
  • 2025년 2분기와 2026년 2분기를 비교하면 6시간 미만 구간은 66.3%에서 50.9%로 줄었고, 24~48시간 구간은 2.0%에서 7.2%, 48시간 이상 구간은 0%에서 1.0%로 증가했다.
  • 연구진은 이 변화가 AI 활용에 따른 소프트웨어 엔지니어링 산출량 증대와 부합하지만, 실제 무AI 대조군이 없고 LLM 판정의 절대 시간 오차가 커서 인과적 증거나 정확한 생산성 향상률로 볼 수 없다고 강조했다.

🧩 주요 포인트

  1. 고노력 산출물이 기록된 근무일의 비중이 확대됐다 → 동일한 기간에 더 복잡하거나 많은 코드가 병합되는 경향은 강해졌지만, 그 원인을 AI로 확정할 수는 없다.
  2. 세 판정 모델은 PR의 상대적 난도 순위에는 높은 합의를 보였으나 절대 시간 규모에는 차이가 컸다 → 중앙값과 넓은 시간 구간은 잡음을 줄이지만 측정 오차 자체를 없애지는 못한다.
  3. 측정값은 관찰된 코드를 AI 없이 똑같이 재현하는 반사실적 비용이다 → AI가 없을 때는 기능 범위나 구현 방식 자체가 달라질 수 있으므로 추정 격차는 실제 절약 시간의 상한에 해당한다.

🧠 상세 정리

1. 연구 질문과 핵심 관찰

Epoch AI는 AI 도구가 그것을 개발하는 소프트웨어 엔지니어의 하루 산출량을 얼마나 끌어올릴 수 있는지 알아보기 위해 OpenAI의 공개 Codex 저장소를 분석했다. 핵심 지표는 협업자 한 명이 특정 날짜에 병합한 작업을 경험 많은 개발자가 AI 없이 재현하는 데 몇 시간이 필요할 것으로 추정되는지였다. 24시간 이상으로 평가된 협업자 근무일의 비중은 2025년 2분기 2.0%에서 2026년 2분기 8.2%로 증가했고, 48시간 이상 구간도 0%에서 1.0%로 늘었다. 이는 한 사람이 하루 안에 직접 수행하기 어려운 규모로 평가된 산출물이 더 자주 나타났다는 뜻이지만, 연구진은 이를 AI가 생산성을 높였다는 직접적인 인과 증거가 아니라 AI 활용 효과와 일치하는 관찰 신호로 제시했다.

2. 분석 자료와 핵심 협업자 선정

원자료는 Codex 저장소가 공개된 2025년 4월부터 2026년 6월 중순까지 병합된 서로 다른 PR 7,524건으로, 약 500개의 GitHub 계정이 기여한 작업을 포함한다. 이 저장소는 스쿼시 병합 방식을 사용하므로 기본 브랜치에서 제목이 PR 번호 형식으로 끝나는 각 커밋을 하나의 병합 PR과 연결할 수 있었다. 전체 기여 계정은 497개였지만, 핵심 분석은 PR의 GitHub 작성자 연관 값이 쓰기 권한을 뜻하는 COLLABORATOR로 표시된 공식 협업자 41명으로 제한했다. Dependabot과 GitHub Actions 같은 자동화 계정은 제외했으며, 저장소 내 지위가 기간 중 바뀐 사람은 GitHub 표지와 신원 정보에 의존한 분류 과정에서 잘못 분류됐을 가능성이 있다는 한계도 명시했다.

3. PR 재구성과 중복 작업 제거

연구진은 로컬 Git 체크아웃에서 각 PR이 최종적으로 만든 순변경분을 추출하고, GitHub GraphQL API를 통해 해당 브랜치 커밋의 작성자와 날짜를 수집했다. 저장소 밖에서 이미 개발된 코드를 한 번에 들여온 대규모 가져오기와, 되돌려진 이전 PR의 코드를 다시 적용한 재병합 작업은 별도로 제거했다. LLM 판정 모델은 한 번에 하나의 PR만 보기 때문에 이런 작업이 외부에서 작성됐거나 이미 계산됐다는 사실을 알 수 없으며, 그대로 포함하면 저장소 안에서 새로 수행된 작업량을 과대평가하게 된다. 제목을 기준으로 한 결정론적 제외 규칙은 전체 7,524건 가운데 6건만 제거했으며, 연구진은 이 처리가 전체 증가 추세를 바꾸지 않았다고 보고했다.

4. LLM 판정 방식과 시간 추정 기준

각 PR의 무AI 재현 시간은 Claude Opus 4.8, GPT-5.5, Gemini 3.1 Pro로 구성된 세 개의 최전선 모델이 독립적으로 추정했으며, 기본 분석에서는 확장 추론 없이 각 제공자의 배치 API를 사용했다. 모델은 PR 제목과 설명, 파일별 변경 줄 수, 브랜치 커밋 메시지, 변경 파일 전반에 고르게 배분된 diff 표본을 읽은 뒤 하나의 시간 값을 제시했고, 최종 점수에는 세 추정치의 중앙값이 사용됐다. 판단 대상은 코드베이스에 이미 합리적인 맥락을 가진 숙련 개발자 한 명이 AI 도구 없이 최종 병합된 순변경분을 설계하고 작성하며 테스트·디버깅하는 데 드는 실작업 시간이다. 코드 리뷰 대기, CI 대기, 회의 같은 절차 비용은 제외했고, 자동 생성 파일이나 단순한 이름 변경·버전 갱신은 diff가 크더라도 낮게 평가하도록 했다. 반대로 줄 수가 적어도 동시성, 파싱, 알고리즘처럼 미묘한 논리를 다루는 변경은 더 오래 걸릴 수 있으므로 단순한 코드량보다 실제 변경의 난도를 중심으로 판단했다.

5. 협업자 근무일 집계와 노력 구간

하나의 PR에 부여된 추정 시간은 그 PR의 커밋이 걸쳐 있는 협업자 근무일에 균등하게 나뉘었고, 같은 협업자가 같은 날짜에 받은 모든 시간 배분을 합산해 하루 단위 노력 수준을 만들었다. 날짜 경계는 미국 태평양 시간대의 달력 날짜를 기준으로 했으며, 각 협업자와 날짜의 고유한 조합을 하나의 협업자 근무일로 정의했다. 합산 시간은 6시간 미만, 6~12시간, 12~24시간, 24~48시간, 48시간 이상의 다섯 구간으로 분류했고, 경계값과 정확히 일치하는 추정치는 더 높은 구간에 넣었다. 다만 실제 근무 기록이 아니라 커밋 시각으로 작업일을 추론하고 PR 시간을 해당 날짜들에 균등 분배한 것이므로, 개별 개발자가 어느 날 얼마만큼 일했는지를 직접 측정한 결과는 아니다.

6. 분기별 변화와 산출량 분포의 이동

2025년 2분기에는 협업자 근무일 101일 가운데 12시간 이상이 14.9%, 24시간 이상이 2.0%였지만, 2026년 2분기에는 844일 가운데 각각 25.1%와 8.2%로 상승했다. 세부 분포를 보면 6시간 미만 구간은 66.3%에서 50.9%로 줄었고, 6~12시간은 18.8%에서 24.0%, 12~24시간은 12.9%에서 16.9%, 24~48시간은 2.0%에서 7.2%, 48시간 이상은 0%에서 1.0%로 늘었다. 변화는 전 기간에 걸쳐 단조롭게 이어진 것은 아니어서 24시간 이상 비중은 2025년 3분기 0.7%, 4분기 1.0%에 머문 뒤 2026년 1분기 5.1%, 2분기 8.2%로 커졌다. 12시간 이상 비중 역시 2025년 3분기 7.1%, 4분기 7.3%에서 2026년 1분기 18.0%로 급격히 높아졌다. 첫 분기는 저장소가 4월 중순에 공개돼 일부 기간만 포함하고 마지막 분기도 6월 중순까지만 포함하며, 제시된 90% 윌슨 점수 구간은 각 협업자 근무일을 서로 독립적인 관측치로 취급해 계산됐다.

7. 판정 모델 간 일치도와 강건성 점검

세 판정 모델은 어떤 PR이 상대적으로 더 오래 걸리는지에 대해서는 로그 척도 쌍별 상관계수 0.95~0.98로 높은 일치도를 보였다. 그러나 절대 규모에서는 차이가 커서 중앙적인 PR을 기준으로 세 값 가운데 가장 높은 추정치가 가장 낮은 추정치의 2.5배에 달했다. 연구진은 이 차이를 완화하기 위해 PR별 중앙값을 취하고 결과를 넓은 시간 구간으로 묶었다. 무작위로 선택한 PR 20건에 높은 수준의 확장 추론을 적용했을 때 중앙 추정치는 10.1% 변했고, 시간 구간이 달라진 사례는 5.5시간에서 6.0시간으로 이동한 한 건뿐이었다. 같은 20건에 파일 읽기 도구와 전체 diff까지 제공했을 때는 높은 추론만 적용한 결과와 비교한 PR별 변화의 중앙값이 0%였지만, 이 소규모 점검이 절대 시간 추정의 정확성을 직접 입증하는 것은 아니다.

8. 인과 해석과 생산성 측정의 한계

연구진은 실제로 AI를 쓰지 않은 비교 집단이나 동일 작업의 관측된 무AI 소요 시간이 없기 때문에 결과가 인과적 증거에는 미치지 못한다고 밝혔다. 추정 질문도 AI가 없을 때 개발자가 현실적으로 무엇을 만들었을지를 묻는 것이 아니라, 이미 관찰된 최종 코드를 AI 없이 정확히 재현하는 비용을 묻는다. AI가 없다면 개발자는 기능을 덜 만들거나 다른 방식으로 구현할 수 있고, 일부 산출물은 그대로 복제하는 비용이 지나치게 클 수 있으므로 추정된 격차는 실제 시간 절약을 과대평가하는 상한이다. 또한 더 길거나 복잡한 PR이 반드시 더 가치 있는 산출물은 아니어서 추정 시간이 곧 사업적·기술적 가치의 증가를 뜻하지 않는다. 기존 METR 연구에서 LLM 예측이 인간 추정의 약 2~3배 범위에 있었다는 검증은 전체 에이전트 작업 기록을 사용한 방법에 관한 것이며, PR diff와 메타데이터만 사용한 이번 분석의 수치에는 그대로 적용되지 않는다.

🧾 핵심 주장 / 시사점

  • 두 비교 분기 사이에는 최상위 구간만 늘어난 것이 아니라 6시간 미만 비중이 감소하고 나머지 모든 상위 구간이 증가해, 협업자 근무일의 추정 노력 분포 전체가 높은 방향으로 이동했다.
  • 분기별 수치는 2025년 3·4분기에 낮아졌다가 2026년에 크게 상승했으므로, 2025년 2분기와 2026년 2분기의 시작·종료 수치만으로는 중간 경로의 비단조적 변화를 확인할 수 없다.
  • 추론 수준과 전체 diff 제공에 따른 시간 구간 변화는 제한적이었지만, 세 모델의 절대 추정 규모 차이와 무AI 실측값의 부재는 남아 있어 결과는 정확한 생산성 배수보다 고노력 산출물 비중의 변화로 해석하는 것이 원문의 결론에 부합한다.

✅ 액션 아이템

  • Codex 협업자 41명의 고노력 근무일 비중 변화(24시간 이상 2.0%→8.2%, 12시간 이상 14.9%→25.1%)를 AI 생산성 향상률이 아닌 절감 시간 상한으로 해석하는 기준을 정한다.
  • PR 난도 추정에서 세 모델의 상대 순위 합의와 절대 시간 편차를 구분해, 중앙값·넓은 시간 구간 결과의 신뢰 범위를 어떻게 둘지 점검한다.
  • 관찰된 PR을 AI 없이 재현하는 반사실적 비용과 실제 무AI 구현 범위 차이를 구분해, 추정 격차를 인과 증거로 쓰지 않는 조건을 정의한다.

❓ 열린 질문

  • 24~48시간·48시간 이상 구간의 증가가 AI 활용 외에 과제 난도나 병합 속도 변화로도 설명 가능한가?
  • 상대 난도 순위 합의가 높은 상황에서 절대 시간 오차를 줄이려면 어떤 보정 기준이 필요한가?
  • 무AI 대조군이 없을 때 추정 격차를 실제 절약 시간의 상한으로 두는 판단 기준은 무엇인가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.