오픈AI 특정 부서의 토큰 사용량이 갑자기 124배 증가한 이유
Quick Summary
오픈AI 연구 부서의 토큰 사용량이 전년 대비 약 124배 늘어난 배경으로, 영상은 연구용 에이전트 활용 확대를 제시하며 비용 그래프에는 작업·연구자 수와 모델 가격 상승도 함께 반영된다고 설명한다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
오픈AI 연구 부서의 토큰 사용량이 전년 대비 약 124배 늘어난 배경으로, 영상은 연구용 에이전트 활용 확대를 제시하며 비용 그래프에는 작업·연구자 수와 모델 가격 상승도 함께 반영된다고 설명한다.
📌 핵심 요점
- 오픈AI는 토큰 판매자인 동시에 내부 연구를 위한 대규모 소비자가 됐다. 영상은 외부 판매가 당기 매출을 만드는 반면, 내부 사용은 비용을 감수하고 다음 모델 개발을 앞당기는 선택이라고 해석한다.
- 연구자별 하루 토큰 사용액의 중앙값은 600달러를 넘고, 상위 10%는 하루 약 6,000~7,000달러를 사용한다고 소개한다. 연구 조직의 토큰 사용량은 전년 대비 약 124배 증가한 것으로 제시된다.
- 에이전트 작업량은 사람의 하루 작업량 대비 약 3일분으로 늘었으며, 연구자의 약 75%가 네 개 안팎 이상의 워크플로를 동시에 운영한다고 설명한다. 다만 병렬 작업 확산이 둔화한 원인을 사람의 배정·검토 능력 한계로 보는 것은 발표자의 해석이다.
- 토큰 비용 증가를 생산성 증가와 동일시할 수는 없다. 모델 가격, 작업 수, 연구자 수, 검증량 등이 섞여 있고, 성공한 4~8시간 작업의 절반 이상에도 최소 한 번의 사람 개입이 필요했다고 전한다.
- 장기 작업의 신뢰성, 도구 오류, 정렬과 모니터링이 다음 확장의 과제로 제시된다. 발표자는 내부 연구에 투입한 토큰이 향후 모델 성능과 경쟁 우위로 이어질 가능성에 주목하지만, 그 성과가 이미 입증됐다고 볼 자료는 제공하지 않는다.
🧩 배경과 문제 정의
영상은 오픈AI 연구 조직의 토큰 소비 급증을 출발점으로, AI 기업이 판매 가능한 컴퓨트를 자사 연구에 사용하는 이유를 설명한다. 핵심 문제는 토큰 사용량 증가를 단순한 비용 확대나 생산성 향상으로 읽어도 되는지, 그리고 에이전트가 더 많은 일을 수행할 때 사람의 역할이 어떻게 달라지는지다.
제시된 근거는 연구자별 토큰 사용액, 부서별 사용량 증가, 에이전트 작업일, 병렬 워크플로 비율, 작업 시간별 성공률이다. 발표자는 이를 연구 자동화 확대의 징후로 해석하면서도 가격 효과, 검증 범위, 사람 개입과 도구 오류를 함께 짚는다. 아래 정리는 제공된 전사문에 한정하며, 화면 속 그래프나 외부 원자료를 별도로 확인한 결과는 아니다.
🕒 시간순 섹션별 상세정리
1. 연구자의 토큰 소비 규모로 시작하는 문제 제기
- 도입부는 하루 600달러 수준과 상위 10%의 하루 6,000~7,000달러 사용액을 소개하며 내부 연구에 투입되는 토큰 비용의 규모를 강조한다. [00:21]
- 오픈AI 연구자의 하루 사용액을 일반 이용자의 월 약 3만 원 ChatGPT 구독료와 대비하며 본론을 시작한다. [00:45]
2. 토큰 판매자가 내부 연구의 대규모 소비자로 전환
- 오픈AI가 고객에게 토큰을 판매하던 컴퓨터를 자사 연구에도 사용하면서, 내부 사용이 매출 대신 비용으로 잡힌다고 보여준다. [01:11]
- 지난해 가을 설정한 자동화 연구 에이전트 목표를 9월 6일 달성했다고 발표하며 내부 지표를 공개했다는 설명이 계속된다. 전사문에는 해당 연도가 명시되지 않는다. [01:23]
- 내부 코딩 에이전트 사용액 그래프의 중앙값이 2월 이후 크게 올라 연구자 한 명당 하루 600달러를 넘었다고 보여준다. [02:03]
3. 상위 사용자의 지출과 연구 조직의 124배 증가
- 상위 10% 연구자의 하루 토큰 사용액은 약 6,000~7,000달러이며, 발표자는 이를 월 약 3억 원 규모로 환산한다. [02:25]
- 매출 성장 둔화처럼 보이는 현상의 원인 중 하나가 제한된 컴퓨트를 내부 연구에 우선 배분한 결과일 수 있다고 추측한다. [02:59]
- 연구 조직의 토큰 사용량은 전년 대비 약 124배 늘어 다른 부서보다 빠르게 증가했으며, 발표자는 AI의 효과가 연구 분야에서 먼저 나타날 가능성을 제기한다. [03:49]
4. 에이전트 작업량과 병렬 워크플로의 확대
- 에이전트 작업일 기준으로 사람 하루당 약 3일분의 일을 수행하며, 약 3개월 사이 0.5배에서 3배로 약 여섯 배 늘었다고 보여준다. [04:30]
- 향후 이 비율이 100일분까지 늘 수 있다는 개인적 전망을 제시한 뒤, 연구자의 약 75%가 네 개 안팎 이상의 워크플로를 동시에 운영한다고 전해진다. [05:09]
- 병렬 작업 비율은 4~6월 급증한 뒤 7월부터 완만해졌으며, 발표자는 사람이 동시에 배정하고 검토할 수 있는 작업 수의 한계를 원인으로 추정한다. [05:27]
5. 사람의 검토 한계와 작업당 토큰 소비
- 발표자는 사람의 기억 용량을 DRAM에 비유하며, 여러 작업을 동시에 맡기고 검토하는 데 인지적 한계가 있다고 보여준다. [05:56]
- 자신의 경우 에이전트에 여러 작업을 맡기면 두세 시간 만에 주간 토큰을 거의 소진하고, 결과 검토 때문에 작업을 무작정 늘리기 어렵다고 드러낸다. [06:30]
- 동시 작업 수가 늘지 않아도 토큰 소비가 증가할 수 있으며, 이를 작업 하나에서 에이전트가 더 자율적으로 수행하거나 더 많은 토큰을 쓰는 상황으로 해석한다. [06:53]
6. 비용 그래프의 혼합 효과와 사람 개입의 역할
- 비용 곡선에는 모델 가격 상승, 작업량과 검증량, 연구자 수가 함께 반영되므로 지출 증가를 하나의 요인으로 설명하기 어렵다고 지적한다. [07:57]
- 최근 6개월 동안 성공한 4~8시간 작업의 절반 이상이 최소 한 번의 사람 개입을 필요로 했으며, 무개입 수행은 시행착오와 비용을 늘릴 수 있다고 보여준다. [08:20]
- 사람이 작업의 틀을 잡는 방식을 권하면서도 사람의 지침이 편향을 만들 수 있다고 덧붙인다. 성공률 분석은 답을 명확하게 검증할 수 있는 작업에 한정됐다고 드러낸다. [08:51]
7. 장기 작업에서 누적되는 오류와 감독 필요성
- 작은 오류나 그럴듯한 잘못된 수정이 후속 실험을 오염시키고 불필요한 작업으로 이어질 수 있어, 장기 작업에서는 의미 있는 감독이 필요하다고 보여준다. [09:32]
- 15분 미만 작업의 무개입 성공률은 약 88%까지 높아졌지만, 더 긴 작업에서는 23%나 13% 수준으로 낮아졌다고 보여준다. 각 수치에 대응하는 정확한 시간 구간은 전사문만으로 확정하기 어렵다. [10:17]
- 2~3일 작업은 무개입 성공률이 20% 미만인 반면, 한 번 이상의 개입을 포함하면 성공률이 약 80%에 도달했다고 보여준다. [11:03]
8. 도구 오류와 정렬·모니터링의 병목
- 32~64시간 작업에서 약 10%의 도구 오류율이 관찰됐다고 소개하며, 긴 작업에서 기본적인 도구 사용 문제도 개선 대상으로 남아 있다고 평가한다. [11:46]
- 야쿠프 파호츠키의 발언을 인용해, 최대 속도로 책임 있게 확장할 만큼 정렬과 모니터링을 충분히 해결한 모델 기업이 아직 없다는 문제를 제기한다. [12:29]
- 외부 판매는 당기 매출을 만들지만 내부 소비는 비용으로 잡히며, 그 대가로 다음 모델을 더 빨리 개발하는 것이 오픈AI의 선택이라는 해석을 제시한다. [12:59]
9. 내부 연구의 투자수익률과 경쟁 우위 전망
- 앤트로픽의 컴퓨트 사용 증가가 매출 증가보다 빠르다는 설명을 바탕으로 내부 연구 배분 확대를 추측하고, 내부 토큰 사용의 투자수익률이 외부 판매보다 높다고 주장한다. [13:34]
- 오픈AI의 다음 목표로 2028년 3월 자동화 AI 연구자를 언급하며, 내부 토큰 비용을 대체하기 어려운 연구개발 자산을 확보하는 지출로 해석한다. [14:15]
- 저렴한 내부 토큰 이용과 최상위 기술이 경쟁 우위를 만든다고 평가한다. 구글과 Grok에 관한 비교도 제시되지만, 경쟁사의 전략과 추격 가능성에 대한 발표자의 판단으로 읽어야 한다. [15:09]
10. 대규모 AI 자기개선 이후의 모델에 대한 기대
- Vera Rubin, Hopper, Grace Hopper 등 하드웨어 세대에 따른 모델 변화에 대한 관심을 언급한 뒤, 앞으로는 대규모 내부 토큰 투입과 AI 자기개선 이후 나오는 모델에 주목한다고 드러낸다. [15:57]
- 이용자가 의미 있게 느끼는 성능, 무엇을 보여줄지에 대한 판단, 매출 극대화와 비용 최소화 같은 전략적 고려도 사람과 토큰이 함께 수행할 것으로 전망한다. [16:28]
- 내부 연구에 많은 토큰을 쓰는 흐름을 자연스러운 선택으로 평가하며, 그 결과로 나올 다음 모델에 대한 기대를 밝히고 마무리한다. [16:43]
🧾 결론
- 124배라는 수치는 연구 조직에서 에이전트 활용이 빠르게 확대됐다는 신호다. 같은 배수의 성과 개선이나 인력 대체를 뜻하지는 않는다.
- 현재 제시된 사례에서는 사람이 작업의 틀을 정하고 중간 결과를 검토하는 방식이 장기 작업의 성공에 중요한 역할을 한다.
- 내부 토큰 소비의 가치는 지출 규모보다 다음 모델의 개발 속도, 결과 품질, 검증에 필요한 사람의 시간으로 판단해야 한다.
- 영상의 최종 관심사는 대규모 내부 연구와 AI 자기개선이 반영된 다음 모델이 어떤 결과를 보여줄지에 있다.
📈 투자·시사 포인트
- 매출과 컴퓨트 사용량이 다르게 움직일 때 내부 연구 배분도 살펴볼 필요가 있다. 다만 영상이 제시한 매출 성장 둔화와 연구 우선 배분의 연결은 확인된 인과관계가 아니라 가설이다.
- 내부 토큰 사용은 단기 비용과 미래 연구 성과 사이의 선택으로 해석할 수 있다. 내부 사용의 투자수익률이 외부 판매보다 높다는 주장은 실제 성과와 원가 자료로 검증해야 한다.
- 발표자는 저렴한 내부 토큰 이용과 최상위 모델 기술의 결합을 경쟁 우위로 본다. 후발 기업이 따라잡기 어렵다는 전망 역시 영상의 평가로 구분해야 한다.
- 에이전트 확산의 경제성을 볼 때 모델 성능뿐 아니라 도구 오류, 사람의 검토 부담, 정렬·모니터링 역량을 함께 평가할 필요가 있다.
⚠️ 불확실하거나 확인이 필요한 부분
- 원본 그래프와 발표 자료가 제공되지 않아 124배의 정확한 비교 기간, 토큰 집계 범위, 대상 연구 조직을 독립적으로 확인할 수 없다. 영상의 '올해'와 '작년', 9월 6일 발표도 기준 연도가 명시되지 않았다.
- 하루 600달러 및 6,000~7,000달러가 어떤 단가로 환산한 사용액인지 불명확하다. 내부 실제 원가, 외부 판매가 기준 환산액, 연구자의 개인 부담액을 동일하게 취급하면 안 된다. 원화 환산과 월 3억 원 설명의 적용 기준도 확인이 필요하다.
- 초반에는 중앙값과 상위 10% 설명이 혼재한다. 이후 설명에서는 왼쪽 그래프를 중앙값, 오른쪽 그래프를 상위 10%로 구분하므로 원본 도표로 확인해야 한다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- 원본 발표와 그래프에서 124배의 기준 기간, 대상 조직, 토큰 집계 방식과 가격 환산 기준을 확인한다.
- 에이전트 운영 기록에서 토큰 수, 적용 단가, 작업 수, 참여 연구자 수를 분리해 비용 증가의 원인을 점검한다.
- 병렬 작업 수를 늘리기 전에 작업 배정과 결과 검토에 드는 사람의 시간을 함께 기록한다.
- 장기 작업에는 중간 검토 지점과 성공 기준을 두고, 사람 개입 횟수·도구 오류·재시도 비용을 측정한다.
❓ 열린 질문
- 124배 증가 가운데 작업 확대, 연구자 수 변화, 작업당 토큰 소비 증가가 각각 차지하는 비중은 얼마인가?
- 병렬 워크플로 확산 둔화는 사람의 검토 능력 때문인가, 아니면 다른 운영 제약도 작용했는가?
- 내부 토큰 사용이 외부 판매보다 높은 투자수익률을 만든다는 주장을 어떤 성과 지표와 기간으로 검증할 수 있는가?