YouTube조코딩 JoCoding·2026년 8월 2일·0

IT뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등

Quick Summary

오픈AI Astra의 10대 난제 도전, DeepSeek V4 Flash의 초저가 오픈 웨이트, Seedance 2.5·MiniMax H3의 영상 생성, Gemini Robotics 2의 정밀 조작은 AI 경쟁이 지능뿐 아니라 검증·가격·로컬 실행·물리 행동으로 확대되고 있음을 보여준다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

IT뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

IT뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등 내용을 설명하는 본문 이미지

💡 한 줄 결론

오픈AI Astra의 10대 난제 도전, DeepSeek-V4-Flash의 초저가 오픈 웨이트, Seedance 2.5·MiniMax H3의 영상 생성, Gemini Robotics 2의 정밀 조작은 AI 경쟁이 지능뿐 아니라 검증·가격·로컬 실행·물리 행동으로 확대되고 있음을 보여준다.

📌 핵심 요점

  1. 오픈AI는 Astra 내부 버전이 수학·이론 컴퓨터과학의 장기 미해결 문제에서 10가지 발전을 만들었다고 공개했으며, 논증을 Lean 인증서로 형식화하고 관련 자료도 공개했다. 다만 이는 수학계가 인정한 최종 해결로 단정할 수 없고, 전문가 검토가 더 필요하다. Astra를 GPT-6라고 부르는 것 역시 현재로서는 추정이다.
  2. DeepSeek-V4-Flash 정식판은 API와 MIT 라이선스의 오픈 웨이트를 함께 제공하며, 공개 비교표에서 Gemini Flash 계열과 경쟁할 수준의 성능과 매우 낮은 비용을 제시했다. 오픈AI도 Luna 가격을 80%, Terra 가격을 20% 인하하고 Sol의 고속 옵션을 내놓아 가격·속도 경쟁에 대응하는 흐름을 보였다.
  3. 같은 GPT-5.6 Sol도 하네스와 추론 압축 방식을 바꾸자 ARC-AGI-3 점수가 13.3%에서 38.3%로 상승했다. 이는 벤치마크가 모델 자체의 지능만 측정하는 것이 아니라 프롬프트, API 설정, 추론 유지 방식과 실행 환경의 영향을 크게 받는다는 점을 보여준다.
  4. Seedance 2.5는 네이티브 30초 생성, 최대 3분의 롱비디오 모드, Blender·Maya 연계를 통해 광고와 영상 제작의 자동화 범위를 넓혔다. 반면 결과 편차와 발음·문자 오류가 남아 있고 30초 생성 비용이 1만 원 이상 들 수 있어, 반복 생성이 많은 작업에서는 비용 부담이 커질 수 있다.
  5. MiniMax H3는 오픈 웨이트 영상 모델과 RTX 3060 구동 가능성을 내세웠고, Gemini Robotics 2는 포장재 잠그기·전구 돌려 빼기·쓰레기봉투 묶기 같은 정밀 작업을 시연했다. 다만 방송 시점에는 H3 가중치와 정확한 메모리 조건이 확인되지 않았으며, Gemini Robotics 2 역시 시연을 넘어 다양한 현실 환경에서 얼마나 안정적으로 일반화되는지는 별도 검증이 필요하다.

🧩 배경과 문제 정의

  • AI 모델 경쟁의 축이 단순한 성능 향상을 넘어 가격 인하, 오픈 웨이트 공개, 로컬 구동 전략으로 빠르게 확장되고 있다.
  • QR 코드 스트림 기반 파일 전송은 화면과 카메라만으로 데이터를 주고받는 새로운 오프라인 통신 방식을 제시한다.
  • 오픈AI의 차세대 모델은 오랫동안 풀리지 않은 수학·이론 컴퓨터과학 문제에 도전하고 있다. 이 과정에서 결과의 형식 검증과 과학 연구의 AI 의존 가능성이 핵심 쟁점으로 떠오른다.
  • 영상 생성, 음성, 로보틱스 분야에서도 생성 길이와 현실감, 정밀 조작 능력이 향상되며 실제 제작과 산업 현장에 적용될 가능성이 커지고 있다.

🕒 시간순 섹션별 상세정리

1. 오픈 웨이트 모델이 촉발한 가격 경쟁

  • DeepSeek V4 Flash는 초저가 API와 오픈 웨이트를 앞세워 상용 AI 모델의 가격 경쟁을 압박한다. [01:20]
  • 딥시크의 가격 공세가 오픈AI의 최근 가격 인하에도 영향을 미쳤을 가능성이 있다. [01:23]

2. QR 스트림을 이용한 네트워크 없는 파일 전송

  • 송신 휴대폰이 데이터를 나눈 QR 코드를 연속 표시하면 수신 휴대폰이 카메라로 이를 읽어 파일을 전송받는다. [02:29]
  • 수신 측은 각 QR 화면의 데이터 조각을 순서대로 결합해 와이파이·블루투스 없이 원본 파일을 복원한다. [03:11]

3. 장기 미해결 문제에서 나온 10대 발전

  • 오픈AI는 수학과 이론 컴퓨터과학의 미해결 문제를 다룬 10가지 연구 성과를 공개했다. [04:30]
  • 대상은 최소 10년간 주요 진전이 없었고 최상위 연구자들도 해결하지 못한 문제들이다. [04:54]

4. 난제 사례와 Lean 인증서를 통한 형식 검증

  • 연구 대상에는 고차원 구형 패킹과 구형 패킹 밀도의 새로운 상한값 문제가 포함됐다. [06:45]
  • 이진 코드와 구형 코드처럼 구조가 복잡해 장기간 해법을 찾기 어려웠던 문제도 다뤘다. [06:58]

5. 차세대 Astra와 과학 연구의 AI 의존 가능성

  • 난제 연구 성과는 차세대 모델 Astra의 내부 버전에서 나왔으며, GPT-6라는 명칭은 아직 추정일 뿐이다. [08:59]
  • Astra급 모델은 장기 미해결 문제를 풀고 그 논증을 Lean 인증서로 공식화하는 연구 역량을 보일 수 있다. [09:23]

6. GPT-5.6 Luna의 대폭적인 가격 인하

  • GPT-5.6의 가격 정책은 비용 대비 성능의 한계를 확장하는 방향으로 변화하고 있다. [11:44]
  • 가장 가벼운 Luna 모델은 7월 30일부터 가격을 80% 인하한다. [11:58]

7. Terra 가격 인하와 GPT-5.6 Sol 고속 옵션

  • Terra는 가격을 20% 낮춰 입력 2달러·출력 12달러에 제공된다. [12:24]
  • GPT-5.6 Sol 패스트 모드는 지능을 유지하면서 최대 2.5배 빠른 속도를 두 배 가격에 제공한다. [12:50]

8. 하네스 변경으로 급상승한 ARC-AGI-3 점수

  • 기본 하네스에서는 출력 토큰을 늘려도 GPT-5.6 Sol의 ARC-AGI-3 점수가 10%대에 머물렀다. [14:36]
  • 리테인드 리즈닝과 컴팩션을 적용하자 같은 모델의 점수가 13.3%에서 38.3%로 뛰었다. [15:17]

9. DeepSeek V4 Flash 정식판과 오픈 웨이트 공개

  • 프리뷰 단계였던 DeepSeek V4 Flash가 정식 출시돼 API와 오픈 웨이트를 함께 제공한다. [17:03]
  • 7월 31일 허깅페이스에 MIT 라이선스 가중치가 공개돼 자유롭게 내려받아 활용할 수 있다. [17:40]

10. Gemini Flash와 맞먹는 공개 벤치마크 성능

  • Artificial Analysis에서 DeepSeek V4 Flash는 Gemini 3.6 Flash와 동일한 점수를 기록했다. [19:20]
  • 공개 모델이 상용 Flash 모델과 동점을 이루며 오픈·폐쇄형 모델의 성능 격차를 좁혔다. [20:05]

11. 초저가 API가 만드는 비용 경쟁력

  • DeepSeek V4 Flash는 Gemini 3.5 Flash Lite보다 높은 성능을 더 낮은 비용으로 제공한다. [20:58]
  • API 비용 지표는 0.03으로, 구글의 저가형 Flash 계열보다 높은 비용 효율을 보인다. [21:15]

12. 양자화 모델의 로컬 구동 조건

  • 오픈 웨이트 공개 후 Unsloth 등의 양자화 버전이 등장했으며, 압축률에 따라 필요한 자원과 성능 손실이 달라진다. [22:29]
  • 4비트는 약 162GB, 3비트는 128GB급 장비가 필요하고 2비트는 같은 장비에서 더 여유롭게 실행할 수 있다. [23:12]

13. 오픈 웨이트 모델의 로컬 운용과 전문가 대담

  • DGX Spark 두 대에서는 초당 약 30토큰을 생성할 수 있어, 전기료만 부담하는 로컬 운용 환경으로 활용할 만하다. [24:12]
  • Y Combinator는 기술 전문가들의 팟캐스트와 강연을 통해 AI 개발 경험과 실용적인 조언을 공유한다. [25:06]

14. 클로드 코드 시스템 프롬프트의 80% 감축

  • Claude Code는 Opus 5의 지능 향상에 맞춰 시스템 프롬프트를 80% 이상 축소했다. [26:07]
  • 최신 모델에는 구형 모델의 약점을 보완하던 복잡한 하네스보다 불필요한 지침을 덜어내는 방식이 더 유리하다. [26:33]

15. 자율 판단 중심으로 바뀌는 컨텍스트 엔지니어링

  • Claude 5 세대에는 절차를 세밀하게 규정하기보다 상황을 스스로 판단할 자율성을 부여하는 방식이 적합하다. [28:00]
  • 다른 장기 추론 모델에도 효과적인지는 추가 실험이 필요하지만, Anthropic의 공식 권고인 만큼 우선 적용해 볼 가치가 있다. [28:51]

16. 2D 이미지를 넘어서는 새로운 모델 벤치마크

  • 자전거를 탄 펠리컨 SVG는 최신 모델들이 모두 능숙하게 생성하면서 벤치마크로서의 변별력을 잃었다. [30:25]
  • 새로운 과제는 『반지의 제왕』 첫 단락을 자바스크립트 애니메이션으로 구현하게 해 이해력·코딩·시각화 능력을 함께 평가한다. [30:50]

17. Seedance 2.5의 생성 길이와 3D 도구 연계

  • Seedance 2.5는 글로벌 출시로 누구나 이용할 수 있게 됐으며, 영상 생성 품질도 향상됐다. [32:48]
  • 네이티브 생성 길이가 15초에서 30초로 늘어나, 여러 장면을 이어 붙이지 않고도 긴 영상을 만들 수 있다. [33:08]

18. 30초 광고 생성과 제작비 절감 가능성

  • Seedance 2.5로 제작한 로지텍 키보드 광고는 조명과 장면 전환을 갖춘 30초 분량의 상업 영상을 구현했다. [34:46]
  • 한 번의 생성으로 광고 한 편을 완성해 기존 촬영과 편집에 투입되던 인력과 시간을 줄일 수 있다. [35:20]

19. Seedance 2.5의 현실감과 프로즌 타임 효과

  • 2.0보다 인물의 피부 톤과 질감이 사실적으로 표현돼, 짧은 테스트에서도 향상된 자연스러움을 확인할 수 있다. [36:48]
  • 프로즌 타임 효과를 활용해 카메라가 피사체 주위를 도는 움직임과 역재생 장면을 구현했다. [37:20]

20. 노래·K팝 뮤직비디오와 2.0 대비 개선

  • 생성된 노래는 음성과 반주가 자연스럽게 이어져 영상과 음악을 함께 제작할 수 있음을 보여준다. [38:02]
  • 가상의 K팝 그룹과 여러 무대 장면을 연결해 짧은 생성 과정만으로 뮤직비디오를 완성했다. [38:13]

21. Dreamina·CapCut 공개와 AI 인플루언서 활용

  • Seedance 2.5는 바이트댄스 제품인 Dreamina와 CapCut에 먼저 공개됐다. [40:15]
  • 최근 두 편의 영상을 Seedance로 제작해 AI 인플루언서 계정의 실제 콘텐츠에 활용했다. [40:39]

22. 반복 생성에서 드러난 결과 편차와 실패 비용

  • 30초 영상 한 편에 1만 원 이상이 들어 비교 생성과 실패 재시도 과정에서 비용이 빠르게 증가한다. [42:44]
  • 같은 프롬프트에서도 카메라 등장 빈도와 구도가 달라져 원하는 결과를 한 번에 얻기 어렵다. [43:03]

23. 해상도별 가격과 상업적 활용 조건

  • 480p는 상대적으로 저렴하지만 720p를 선택하면 반복 제작 비용이 크게 높아진다. [44:48]
  • 사람을 고용해 촬영·편집하는 전체 비용과 비교하면 광고 제작에서는 생성 비용이 더 저렴할 수 있다. [44:56]

24. 오픈 웨이트 MiniMax H3의 벤치마크 성능

  • MiniMax H3는 영상 생성이 가능한 멀티모달 오픈 웨이트 모델이다. [46:13]
  • 텍스트-투-비디오에서는 Seedance 2.0을 앞섰고 이미지-투-비디오에서는 2위였지만, 비교 순위의 신뢰성에는 의문이 남는다. [47:08]

25. RTX 3060 구동을 목표로 한 MiniMax H3

  • 공개를 앞둔 MiniMax H3는 RTX 3060 한 장에서도 실행할 수 있는 로컬 영상 모델로 주목받았다. [48:20]
  • 8비트 가중치와 32GB 메모리 구동 사례가 나왔지만, 해당 메모리가 VRAM인지는 명확하지 않다. [48:48]

26. 한국어 K드라마 샘플과 오픈 웨이트 활용성

  • MiniMax H3의 K드라마 샘플에는 두 인물이 관계를 주제로 한국어 대화를 나누는 장면이 담겼다. [50:40]
  • 한국어 음성과 대사 톤은 비교적 자연스럽지만 영상에는 AI 특유의 인공적인 인상이 남았다. [50:52]

27. Grok Imagine Video 1.5의 움직임 개선

  • Grok Imagine Video 1.5는 레퍼런스 이미지를 입력해 전반적으로 안정적인 영상을 생성한다. [52:14]
  • 이전 버전과 동일한 프롬프트를 사용한 비교에서 캐릭터의 춤과 신체 움직임이 더 자연스러워졌다. [53:07]

28. 추론과 도구 사용을 결합한 Grok Voice Think Fast 2.0

  • Grok Voice Think Fast 2.0은 음성 추론과 도구 사용을 결합한 실시간 대화를 목표로 한다. [54:09]
  • 비교 평가에서 음성 품질 82.9점과 음성 추론 97.2점을 기록했다. [54:28]

29. CrisperWhisper 2.0의 오픈 웨이트 전사 성능

  • CrisperWhisper 2.0은 허깅페이스에서 가중치를 받아 자막과 영상 전사에 활용할 수 있는 ASR 모델이다. [56:29]
  • 비교 평가에서 폐쇄형 ElevenLabs Scribe V2의 79.2점보다 높은 87.8점을 기록했다. [57:13]

30. Gemini의 한시적 무료 영상 생성 혜택

  • Google Gemini는 8월 4일까지 영상 10개를 무료로 생성할 수 있는 한시적 혜택을 제공한다. [59:48]
  • 기존에 영상 생성 기능을 사용하지 못했던 이용자도 무료 할당량으로 직접 시험해 볼 수 있다. [59:57]

31. Gemini Robotics 2의 정밀 물체 조작

  • 포도를 지퍼백에 넣고 입구를 잠그는 과정에서 작은 물체와 유연한 포장재를 정교하게 다룬다. [1:00:53]
  • 깨지기 쉬운 전구에는 힘을 세밀하게 조절하며 천천히 돌려 빼는 동작을 수행한다. [1:01:15]

32. 행동·추론·온디바이스로 나뉜 로봇 모델

  • Gemini Robotics 2는 시각·언어·행동을 결합해 언어 지시를 실제 로봇 동작으로 변환한다. [1:02:30]
  • 별도의 Robotics ER2는 추론을 담당하며 물리 행동 모델의 판단 능력을 보완한다. [1:02:47]

33. Figure 03의 사다리 등반

  • Figure 03은 손잡이와 발판을 차례로 짚으며 사람처럼 균형을 유지해 사다리를 오른다. [1:04:17]
  • 상단에서는 팔을 옮겨 걸고 몸 전체를 끌어올려 등반을 마친다. [1:04:47]

34. 에이전트 맥락을 공유하는 CTX Flow

  • 조코헌트 주간 1위 CTX Flow는 AI 에이전트가 작업마다 처음부터 다시 시작해야 하는 문제를 해결하려 한다. [1:05:30]
  • 프로젝트 상태와 축적된 지식을 협업 과정에 연결해 여러 에이전트가 동일한 맥락을 공유하도록 한다. [1:05:51]

35. 데이터센터 구축 게임과 반도체 생태계

  • 스팀의 ‘데이터 센터’ 게임은 데이터센터 산업을 직접 구축하며 이해하는 체험을 제공한다. [1:08:14]
  • 케이블 배선과 엔비디아 장비 반입 과정을 살펴보며 국내 메모리·HBM 생태계도 함께 언급한다. [1:08:37]

36. 데이터센터 게임 스트리밍 준비와 방송 종료

  • 과거 AI NPC 게임의 높은 조회수와 반도체 주주들의 관심 가능성을 근거로 데이터센터 게임을 방송 대상으로 선택한다. [1:10:04]
  • 라이브 스트림과 자동 이동을 설정한 뒤 방송 제목과 카테고리를 지정하며 데이터센터 게임 학습 방송 준비로 마무리한다. [1:10:42]

🧾 결론

  • 이번 흐름의 핵심은 단일 벤치마크 1위가 아니라 연구 난제 해결, 초저가 추론, 오픈 웨이트, 장시간 영상 생성, 로봇 행동까지 AI의 적용 범위가 동시에 넓어지고 있다는 점이다.
  • 오픈 웨이트 모델이 상용 모델에 근접하면서 모델 접근 비용은 낮아지고 있지만, 고성능 로컬 구동에는 여전히 대용량 메모리와 상당한 초기 하드웨어 투자가 필요하다.
  • 영상 생성은 제작 인력과 시간을 줄일 가능성이 크지만, 실패 결과를 다시 생성하는 비용까지 포함해야 실제 경제성을 판단할 수 있다.
  • 검증이 필요한 핵심 항목은 Astra 연구 결과의 전문가 승인 여부, 벤치마크별 동일 실행 조건, MiniMax H3의 실제 공개 사양, Gemini Robotics 2의 장기 안정성과 현실 환경 일반화 성능이다.

📈 투자·시사 포인트

  • 저가·오픈 웨이트 모델의 확산은 범용 API 가격과 모델 제공사의 마진을 압박할 수 있다. 반대로 추론 사용량이 크게 증가한다면 전체 컴퓨팅·전력·데이터센터 수요를 확대하는 요인이 될 수 있다.
  • DeepSeek-V4-Flash와 MiniMax H3 같은 로컬 모델의 발전은 GPU뿐 아니라 고용량 메모리, 통합 메모리 시스템, 양자화 소프트웨어와 로컬 추론 도구 생태계의 중요성을 높인다. 다만 실제 수혜 여부는 모델별 하드웨어 요구량과 생성 속도를 확인한 뒤 판단해야 한다.
  • Seedance 2.5는 광고·뮤직비디오·AI 인플루언서처럼 최종 산출물의 가치가 높은 시장에서 제작비 절감 가능성을 보여준다. 사업성을 평가할 때는 표시 가격보다 성공본 확보에 필요한 평균 생성 횟수, 후반 작업 비용, 상업 이용 조건을 함께 봐야 한다.
  • Gemini Robotics 2는 AI 모델의 가치가 화면 속 답변에서 실제 노동과 자동화로 이동할 가능성을 시사한다. 로봇 본체뿐 아니라 센서, 액추에이터, 엣지 컴퓨팅과 시스템 통합 영역까지 장기적인 관찰 대상이 될 수 있지만, 시연 영상만으로 상용화 시점이나 수익성을 단정해서는 안 된다.
  • 투자 판단 전에는 공식 가격표와 라이선스, 독립 벤치마크, 실제 로컬 구동 사양, 로봇의 작업 성공률·안전성·운영비를 확인해야 하며, 영상에 소개된 비교 수치와 시연 결과는 출발점으로만 활용하는 것이 적절하다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 오픈AI의 수학·이론 컴퓨터과학 관련 결과는 영상에서 ‘10대 발전’으로 소개됐지만, Lean 인증서가 있다는 사실만으로 완전한 증명이나 학계의 최종 승인을 의미하지는 않는다. 논문 원문, 인증서의 검증 범위, 독립 연구자의 재현 및 동료평가 결과를 별도로 확인해야 한다.
  • 해당 연구에 사용됐다는 ‘Astra’는 내부 명칭으로 소개됐으며, 정식 제품명이나 ‘GPT-6’와의 관계는 확정되지 않았다. 따라서 Astra를 GPT-6로 단정해서는 안 된다.
  • DeepSeek의 가격 경쟁이 오픈AI의 Luna·Terra 가격 인하에 영향을 줬다는 설명은 인과관계가 확인된 사실이 아니라 영상 내 추정이다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 오픈AI가 공개한 난제 연구의 논문·Lean 인증서·공식 발표를 찾아 10개 결과의 문제명, 신규 기여 범위, 독립 검증 상태를 구분해 정리한다.
  • Astra가 공식 모델명인지 내부 코드명인지 확인하고, GPT-6로 표기할 근거가 나오기 전까지 두 명칭을 분리해 사용한다.
  • DeepSeek V4 Flash의 공식 모델 카드, 라이선스, API 가격표와 공개 가중치를 확인하고 영상 속 벤치마크 수치의 평가 조건을 함께 기록한다.
  • 동일 모델에서 기본 하네스와 리테인드 리즈닝·컴팩션 구성을 비교해, ARC-AGI-3 점수 상승이 재현되는지 검증한다.

❓ 열린 질문

  • Lean 인증서가 검증한 것은 전체 수학적 주장인가, 아니면 논증의 일부 형식화에 한정되는가?
  • 오픈AI의 10개 결과 중 독립 전문가가 재현하거나 학술적으로 인정한 성과는 현재 몇 개인가?
  • DeepSeek V4 Flash의 비용 우위는 긴 컨텍스트, 도구 호출, 실제 에이전트 작업에서도 유지되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.