AI뉴스 - ox-alpha 열풍, 오픈AI RL 중지, Mythos 5 개방, Gemini 하입과 무료, 모더나 머크, 독파모, 통속의 뇌, 로봇 올림픽 등
Quick Summary
OX Alpha 열풍과 OpenAI의 일부 frontier RL 중단부터 무료 모델, AI 신약, 독파모 논란, 생체 컴퓨팅과 로봇 올림픽까지, 이번 뉴스는 AI 경쟁의 중심이 단일 모델 성능에서 접근성·에이전트 설계·현실 세계 적용으로 빠르게 확장되고 있음을 보여준다.
영상 보기
클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 결론
OX Alpha 열풍과 OpenAI의 일부 frontier RL 중단부터 무료 모델, AI 신약, 독파모 논란, 생체 컴퓨팅과 로봇 올림픽까지, 이번 뉴스는 AI 경쟁의 중심이 단일 모델 성능에서 접근성·에이전트 설계·현실 세계 적용으로 빠르게 확장되고 있음을 보여준다.
📌 핵심 요점
- OX Alpha는 OpenRouter에 무료로 등장한 정체불명의 멀티모달 모델로, 100만 토큰 문맥과 장기 에이전트 작업을 내세웠다. 소프트웨어 엔지니어링 벤치마크 점수는 최초 80%에서 재측정 후 63%로 수정됐지만, 여전히 Fable의 65%와 비슷한 frontier급 성능으로 평가됐다.
- OpenAI는 새로운 능력 수준에 맞는 정렬·보안·모니터링 기준을 갖추기 위해 일부 frontier RL 훈련을 중단했다고 전했다. 동시에 GPT 5.6-Sol 가격 인하, Codex의 100만 토큰 설정, GPT Image 2의 투명 배경 지원처럼 실사용 비용과 기능을 개선하는 소식도 제시됐다.
- AI 활용의 초점은 모델 호출을 넘어 작업 실행으로 이동했다. X 광고 MCP, Comfy MCP, ChatGPT와 Apple Messages 연결, MiniMax-H 3 기반 게임 스프라이트 제작, NVIDIA의 ARC-AGI 에이전트 반복 harness가 대표 사례다.
- 오픈 웨이트와 로컬 실행 생태계도 확장됐다. DeepSeek V3 Flash Vision, Qwen 계열 무검열 모델, Sensu v1.5, Qwen-Video-Edit, 4DGaussian, FreeToken은 저비용·로컬 환경에서도 멀티모달 생성과 대형 모델 추론이 가능해지는 흐름을 보여준다.
- AI의 적용 범위는 맞춤형 암 백신, 살아 있는 인간 뉴런을 결합한 생물학적 데이터센터, 한 번의 시연으로 학습하는 로봇, 인간 기록을 넘어섰다고 소개된 휴머노이드 달리기와 비행형 로봇까지 확대됐다. 반면 독파모 평가에서는 객관적 벤치마크의 낮은 비중과 비공개 사용자 평가가 공정성 논란을 낳았다.
🧩 배경과 문제 정의
- 영상은 짧은 주기로 쏟아지는 AI 모델, 개발 도구, 의료·반도체·로봇 뉴스를 묶어 기술 변화의 방향을 살펴보는 주간 뉴스 형식이다.
- 핵심 문제는 발표 수치와 정체가 불명확한 모델의 hype를 그대로 받아들이지 않으면서도, 무료화·오픈 웨이트·에이전트 자동화가 실제 활용 비용과 산업 구조를 어떻게 바꾸는지 판단하는 데 있다.
- 전반부는 모델과 개발 생태계, 중반부는 바이오·로컬 생성·추론 하드웨어, 후반부는 한국형 모델 평가·생체 컴퓨팅·휴머노이드와 사용자 제작 서비스로 범위를 넓힌다.
🕒 시간순 섹션별 상세정리
1. OX Alpha의 등장과 벤치마크 정정
- OpenRouter에 먼저 공개된 OX Alpha는 텍스트·이미지·비디오 입력, 100만 토큰 문맥, 효율적인 코딩과 지속적 에이전트 작업을 내세우며 현재 무료로 제공된다고 소개됐다. [00:22]
- 소프트웨어 엔지니어링 벤치마크가 처음에는 80%로 알려졌지만 재실행 후 63%로 정정됐고, Fable의 65%와 비슷한 frontier급 모델이라는 평가가 남았다. [00:58]
- 토크나이저와 시스템 프롬프트를 근거로 GLM 후속 모델이라는 추측과 Google·Gemini 관련설이 제기됐지만, 개발 주체와 실제 성능은 공개되지 않았다. [02:32]
2. OpenRouter의 플랫폼 가치와 OpenAI의 RL 중단
- Stripe가 OpenRouter를 인수했으며 거래가는 비공개지만 70억 달러 이상으로 추정된다는 주장이 소개됐다. 하나의 API로 다수의 개방형·폐쇄형 모델을 연결하는 라우터의 집계 가치가 강조됐다. [03:18]
- Sam Altman의 게시물을 인용해 OpenAI가 새로운 능력 수준에 맞는 정렬·보안·모니터링 기준을 충족하기 위해 일부 frontier RL 훈련을 중단했다고 설명했다. [03:48]
- GPT 5.6-Sol은 입력 비용 20%, 출력 비용 33% 인하가 제시됐으며 프로모션 가격은 적어도 2026년 11월 21일까지라고 전했다. [04:06]
3. Codex 문맥 설정과 생성 도구의 실용화
- Codex는 기본 설정에서 100만 토큰이 모두 차기 전에 자동 압축하므로 config.toml의 model context window 설정을 조정해야 전체 문맥을 사용할 수 있다고 설명했다. 다만 큰 문맥이 항상 더 효율적인 것은 아니라고 덧붙였다. [04:52]
- GPT Image 2 API의 투명 배경 지원으로 게임 캐릭터와 스티커 제작 시 녹색 배경을 만들고 제거하던 과정이 불필요해졌다고 소개했다. [05:14]
- 무료 공개된 MiniMax-H 3로 걷기·점프·공격 동영상을 생성한 뒤 프레임별 자세를 잘라 게임 스프라이트 애니메이션으로 만드는 사례가 제시됐다. [05:50]
4. 메시지 연결, 개발자 행사와 Claude 학습 도구
- ChatGPT를 Apple Messages와 연결해 메시지 문맥 파악, 일정 확인, 답변 추천을 수행할 수 있으며 연결 지점이 ChatGPT 쪽으로 통합되는 흐름을 설명했다. [06:25]
- OpenAI DevDay는 샌프란시스코에서 9월 29일, DevDay Exchange Seoul은 10월 22일 개최되며 서울 행사의 신청 마감은 9월 4일이라고 안내했다. [06:50]
- Claude Security Scan의 기업 고객 대상 공개 베타, 무료 Claude Academy, 적은 글과 큰 그림으로 개념을 설명하는 Anthropic 내부 .5 skill이 차례로 소개됐다. [08:05]
5. Grok 접근 확대와 에이전트형 광고 집행
- Grok은 Super Grok Plus, Cursor Pro Plus, Cursor Teams 등으로 접근 범위가 확대되고 모든 사용자에게 제한적 무료 체험이 제공된다고 전했다. [08:28]
- X 광고용 MCP는 캠페인 예산과 지역을 자연어로 지시하면 AI 에이전트가 타깃 분석과 광고 집행을 자동으로 처리하는 도구로 소개됐다. [09:12]
- Google은 학생에게 Gemini를 1년간 무료 제공하고 사용량 확대, 400GB 저장공간과 학습 자료 혜택을 제공하며, Anti-Gravity에는 원격 제어가 추가됐다고 설명했다. [09:42]
6. ARC-AGI harness와 오픈 웨이트 모델의 양면성
- NVIDIA A4라는 agent variation loop에 Claude Opus 3.5를 결합해 ARC-AGI에서 100점을 달성했다는 사례를 통해 모델이 같아도 harness 설계로 성능을 크게 높일 수 있다고 주장했다. [10:39]
- DeepSeek V3 Flash Vision은 비전 능력을 추가해 Opus 3.5에 근접하거나 일부 성능에서 앞선다고 소개됐으며 API로 제공된다고 전했다. [10:59]
- Qwen 계열 무검열 오픈 모델은 로컬 실행과 보안 연구에 활용될 수 있지만, 무기·마약·금융범죄 같은 위험 정보를 제한 없이 제공할 수 있다는 문제도 함께 드러났다. [12:11]
7. Moderna 맞춤형 암 백신과 AI의 역할
- Moderna의 주가가 110% 이상 상승한 사건과 함께 개인 맞춤형 암 백신이 Phase 3 임상에 성공했다는 소식이 소개됐다. [12:30]
- 표준 치료제 Keytruda가 T세포의 공격을 가능하게 하고, 환자별 백신은 종양 표적의 수배 전단을 제공해 T세포가 공격할 대상을 식별하도록 돕는다는 비유로 작동 원리를 설명했다. [13:23]
- AI는 종양 조각의 유전자 서열을 읽고 후보를 고르는 과정을 단축해 1억 원 이상으로 언급된 비용을 낮추는 역할을 하며, 약은 2027년경 이용 가능할 수 있다고 전했다. [13:51]
8. 로컬 이미지·비디오·4D 생성 생태계
- Comfy MCP가 로컬에서도 공식 지원되면서 Claude Code나 Cursor가 워크플로 다운로드와 설치를 처리하고, 사용자는 공식 프롬프트를 복사해 연결할 수 있다고 설명했다. [14:41]
- 80억 매개변수의 오픈 웨이트 이미지 모델 Sensu v1.5는 텍스트 표현, 세부 묘사, 사진형 이미지와 다중 입력 변환에서 준수한 결과를 보인다고 소개됐다. [15:13]
- Qwen-Video-Edit는 이미지 편집을 연속 프레임에 적용해 로컬에서 영상을 변환하며, 4DGaussian은 스마트폰 영상으로 여러 시점에서 볼 수 있는 4D 장면을 생성하고 모델도 공개했다고 전했다. [16:19]
9. 제한된 VRAM 추론과 차세대 AI 칩
- UC Berkeley와 MIT의 FreeToken은 CPU DRAM과 GPU VRAM을 대역폭에 맞게 나눠 사용해 5090에서 248B 모델을 초당 25토큰, 8GB 4060 노트북에서 35B 모델을 초당 39토큰으로 실행했다고 소개됐다. [17:17]
- Cerebras CS4는 wafer 전체를 하나의 추론 칩으로 사용해 GPU 대비 최대 30배 빠른 추론과 CS3 대비 watt당 최대 10배 높은 처리량을 제공한다고 전했다. [17:57]
- 모델을 실리콘에 직접 새기는 Talus 방식과, 한 엔지니어가 특허를 분석해 Hugging Face checkpoint의 양자화·칩 식각 준비 과정을 구현한 사례가 소개됐다. [18:41]
10. 독파모 평가 결과와 공정성 논란
- 정부의 독자 foundation model 사업 2차 평가에서 Upstage, SK, LG가 통과하고, 벤치마크 최고점 47점을 받은 Motif 3가 탈락하면서 대기업 편향 논란이 발생했다고 전했다. [19:15]
- 공개된 배점에서는 벤치마크 평가가 40점에 그치고 전문가·사용자 평가 비중이 더 높아, 순수 모델 점수가 높아도 탈락할 수 있는 구조였다고 설명했다. [19:38]
- 사용자 평가 질의와 응답이 공개되지 않은 상황에서 객관적 지표의 비중을 높이고 전문 영역을 더 충실히 평가해야 한다는 비판을 제기했다. [20:24]
11. 카메라형 AirPods, 자동 채혈과 생체 컴퓨팅
- visionOS 2.2 RC에서 카메라로 시각 정보를 인식하는 AirPods 관련 영상이 발견됐으며, 안경보다 가벼운 형태로 Apple Intelligence와 비전 기능을 사용할 가능성이 제시됐다. [21:04]
- 정맥을 스캔하고 알코올을 분사한 뒤 바늘을 삽입해 자동으로 채혈하는 장치가 소개됐다. [21:21]
- Cortical Labs의 Brain-PU는 1,600만 개의 살아 있는 인간 뉴런을 실리콘 하드웨어와 결합해 Doom을 실행하며, 약 25~30W의 낮은 전력을 사용한다고 설명했다. [22:14]
12. 한 번 보고 배우는 로봇과 인간형 외관
- Gen 1.5는 장갑을 착용한 사람이 작업을 한 번 시연하면 분류, 로봇청소기 분해, 지퍼 조작 등을 따라 하는 one-shot learner로 소개됐으며 과제별 성공률은 달랐다. [22:47]
- UBTECH의 U1 휴머노이드는 눈 깜빡임과 얼굴 표정이 자연스럽고 사람과 유사한 외형을 보여 인간과 로봇의 관계 변화 가능성을 언급하게 했다. [23:06]
13. 로봇 올림픽과 이동 형태의 확장
- 2026 World Humanoid Robot Games에는 66개 팀이 참가했고, 퍼레이드·촬영·달리기 등 경기 운영과 참가 장면 전반에 로봇이 등장했다. [23:33]
- 2025년보다 달리기 속도가 크게 향상됐으며 9.3초 기록이 인간 세계기록보다 빠르다고 소개됐다. Unitree 로봇은 2m 점프와 축구 동작도 선보였다. [24:33]
- 휴머노이드가 기어 다니다 드론과 결합해 비행한 뒤 다른 장소에서 다시 걷는 변형형 이동 시스템도 공개됐다. [24:57]
14. 사용자 제작 서비스와 마무리
- 주간 제작물 공동 1위로 전화번호 없이 초대와 수락만으로 연결하는 KL Talk, 그리스 신화를 활용한 욕망 테스트, 사진 한 장으로 카카오톡 이모티콘 15종을 만드는 서비스가 소개됐다. [26:10]
- 투명 배경 기능을 활용한 이모티콘 제작과 vibe coding 기반 1인 서비스 개발을 권하고, 관련 책과 무료 3시간 강의를 안내한 뒤 다음 주 뉴스를 예고하며 영상을 마쳤다. [26:32]
🧾 결론
- 이번 뉴스의 공통축은 더 큰 모델 하나가 아니라 모델·라우터·에이전트 harness·MCP·하드웨어를 조합해 실제 작업 성능을 끌어올리는 시스템 경쟁이다.
- 무료 체험, 오픈 웨이트, 로컬 실행, 가격 인하는 고성능 AI의 접근 장벽을 낮추지만, 무검열 모델의 위험과 frontier RL의 안전성처럼 통제 비용도 함께 키운다.
- AI는 소프트웨어와 콘텐츠 생성 단계를 넘어 광고 집행, 의료, 생체 컴퓨팅, 로봇 노동과 스포츠처럼 물리적 결과를 만드는 영역으로 진입하고 있다.
- 벤치마크 수치만으로 기술 우위를 단정하기 어렵다. OX Alpha의 점수 수정과 독파모 논란은 재현성, 평가 가중치, 실제 사용자 성능을 함께 검토해야 한다는 점을 드러낸다.
📈 투자·시사 포인트
- OpenRouter 사례처럼 여러 모델을 하나의 API로 연결하는 라우팅·집계 계층은 모델 자체를 만들지 않아도 높은 사용량 성장과 전략적 가치를 확보할 수 있는 영역으로 제시됐다.
- NVIDIA의 harness 사례와 FreeToken의 메모리 분할 실행은 원천 모델 성능뿐 아니라 에이전트 반복 구조, 추론 최적화, CPU·GPU 자원 배치가 비용 대비 성능을 결정할 수 있음을 시사한다.
- Cerebras CS4와 모델을 실리콘에 직접 새기는 Talus 방식은 AI 반도체 경쟁이 범용 GPU에서 wafer-scale inference와 모델 특화 칩으로 다변화될 가능성을 보여준다.
- Moderna의 맞춤형 암 백신 사례는 AI가 유전자 분석과 표적 후보 선정을 단축해 개인화 치료의 제작 비용과 시간을 낮추는 보조 기술로 자리 잡을 가능성을 제시한다.
- 휴머노이드의 학습 속도와 운동 능력 향상은 중국 로봇 생태계와 범용 로봇 플랫폼의 진전을 보여주지만, 영상 속 기록·성공률과 상용 환경의 안정성은 분리해서 평가해야 한다.
⚠️ 불확실하거나 확인이 필요한 부분
- OX Alpha의 개발 주체는 공개되지 않았다. GLM 계열, Google 또는 Gemini와의 관련성은 시스템 프롬프트·토크나이저 유사성과 관계자의 게시물을 근거로 한 추측일 뿐이다.
- OX Alpha의 벤치마크는 최초 80%에서 재실행 후 63%로 수정됐다. 평가 조건, 데이터 오염 여부, 다른 모델과의 동일 조건 비교는 본문에 제시되지 않았다.
- Stripe의 OpenRouter 인수와 70억 달러 이상이라는 추정 가치는 영상에서 주장됐지만, 정확한 거래 가격은 공개되지 않았다고 설명됐다.
- 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
- 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
- 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.
✅ 액션 아이템
- OpenRouter에서 OX Alpha를 동일한 코딩 과제와 장기 에이전트 과제로 시험하고, 성공률·비용·지연시간·문맥 유지 능력을 기존 모델과 비교한다.
- Codex의 100만 토큰 설정을 적용하기 전에 현재 config.toml과 자동 압축 동작을 확인하고, 큰 문맥과 중간 압축 방식의 품질·비용 차이를 소규모 과제로 측정한다.
- X 광고 MCP나 Comfy MCP를 도입할 때는 결제·광고 집행·파일 다운로드 같은 부작용 작업에 승인 단계, 예산 상한, 실행 로그를 둔다.
- OX Alpha, ARC-AGI, Moderna 임상, 독파모 평가 결과처럼 의사결정에 영향을 주는 수치는 공식 발표와 평가 문서에서 다시 검증한다.
❓ 열린 질문
- OX Alpha의 실제 개발사는 어디이며, 추후에도 무료 접근이나 오픈 웨이트 공개가 유지될까?
- OpenAI가 frontier RL 훈련을 재개하기 위해 요구하는 정렬·보안·모니터링 기준은 구체적으로 무엇일까?
- ARC-AGI 성능 향상 중 기반 모델의 지능과 NVIDIA harness의 반복·검증 구조가 각각 기여한 비율은 어느 정도일까?