YouTube조코딩 JoCoding·2026년 8월 3일·0

AI뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등

Quick Summary

Astra의 검증 가능한 난제 해결부터 DeepSeek·Seedance·MiniMax·Gemini Robotics의 비용·제작·로봇 진전까지, 최신 AI 경쟁의 기준은 모델 성능 하나가 아니라 검증성·실행 비용·도구 통합·로컬 구동성으로 이동하고 있다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

AI뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

AI뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등의 핵심 내용을 4단계로 요약한 인포그래픽
AI뉴스 - 오픈AI Astra 10대 난제 해결, DeepSeek-V4-Flash 정식, Seedance 2.5, MiniMax H3, Gemini Robotics 2 등 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Astra의 검증 가능한 난제 해결부터 DeepSeek·Seedance·MiniMax·Gemini Robotics의 비용·제작·로봇 진전까지, 최신 AI 경쟁의 기준은 모델 성능 하나가 아니라 검증성·실행 비용·도구 통합·로컬 구동성으로 이동하고 있다.

📌 핵심 요점

  1. Astra 내부 버전은 최소 10년간 주요 진전이 없던 수학·이론 컴퓨터과학 난제 10개를 풀었으며, 각 논증을 Lean 인증서로 공식화해 그럴듯한 생성과 실제 증명을 기계적으로 구분할 수 있게 했다.
  2. GPT-5.6 계열은 루나 가격을 80%, 테라 가격을 20% 인하하고 속도 옵션을 넓혔다. 동시에 추론을 보존하는 하네스가 ARC-AGI-3 점수를 13.3%에서 38.3%로 끌어올린 사례와 Claude Code의 시스템 프롬프트 80% 이상 축소는 모델 평가에서 하네스·프롬프트·API 설정이 핵심 변수임을 보여준다.
  3. DeepSeek-V4-Flash는 API와 MIT 라이선스 오픈 웨이트를 함께 제공하며, Fable 5 대비 약 105분의 1이라는 API 비용 경쟁력을 제시했다. 다만 로컬 실행에는 4비트 약 162GB, 3비트 128GB 통합 메모리가 필요해 양자화 수준과 하드웨어 조건을 함께 계산해야 한다.
  4. Seedance 2.5는 네이티브 30초 생성과 최대 3분 제작 파이프라인, 3D 도구 플러그인을 결합했다. MiniMax H3는 오픈 웨이트 영상 생성·편집 경쟁력을, Imagine Video 1.5는 최대 15초·1080p 출력을 제시했으며, Grok Voice Think Fast 2.0과 Crisper Whisper 2.0은 실시간 음성 추론과 오픈 음성 인식의 진전을 보여줬다.
  5. Gemini Robotics 2는 지퍼백 잠그기, 전구 돌려 빼기, 쓰레기봉투 묶기 같은 정교한 조작을 수행했고 온디바이스 구성까지 포함했다. CTX Flow는 여러 AI 에이전트가 문서 기반 맥락을 공유하고 토큰 사용량을 관리하게 해 실제 작업 자동화의 운영 문제를 다룬다.

🧩 배경과 문제 정의

  • 수학 난제 증명부터 영상·음성·로봇까지 AI의 적용 범위가 넓어지면서, 결과의 검증 가능성과 실제 작업에 투입할 수 있는지가 중요해졌다.
  • 모델의 실용 가치는 가중치 성능만이 아니라 하네스, 시스템 프롬프트, API 가격, 양자화 방식, 구동 하드웨어에 따라 크게 달라진다.
  • 오픈 웨이트 모델은 비용과 로컬 실행 장벽을 낮추지만, 생성 비용과 벤치마크 조건을 함께 살펴야 실제 가성비를 판단할 수 있다.

🕒 시간순 섹션별 상세정리

1. 아스트라의 수학 난제 증명과 검증

  • 최소 10년간 주요 진전이 없던 수학·이론 컴퓨터과학 난제 10개를 AI가 풀면서, 인간 연구자가 장기간 막혀 있던 전문 추론 영역까지 자동화 범위가 넓어졌다. [00:13]
  • 각 논증을 Lean 인증서로 공식화해 기계적으로 검증할 수 있으므로, 그럴듯한 답만 생성하는 할루시네이션과 실제 증명을 구분할 수 있다. [00:45]

2. GPT-5.6 가격 인하와 하네스의 성능 효과

  • 경량 모델 루나는 가격을 80%, 중간 모델 테라는 20% 인하했고, 테라의 요금은 입력 2달러·출력 12달러 수준으로 낮아졌다. [01:59]
  • Sol 수준의 성능을 유지하면서 스탠더드보다 최대 2.5배 빠른 옵션을 두 배 가격에 제공해, 비용뿐 아니라 처리 속도에 따른 선택지도 넓어졌다. [02:02]

3. DeepSeek-V4-Flash의 오픈 웨이트와 가격 경쟁력

  • 정식 버전은 API와 오픈 웨이트를 모두 제공하며 MIT 라이선스를 채택해, 상업적 활용과 자체 배포의 제약을 크게 낮췄다. [03:24]
  • 성능은 구글의 최첨단 플래시 모델과 비슷하면서 Gemini 3.5 Flash Lite보다 저렴하고, Fable 5와 비교하면 API 비용이 약 105분의 1 수준이다. [04:13]

4. 지능 향상에 따른 프롬프트 축소와 벤치마크 전환

  • Claude Code는 모델 지능이 높아지면서 이전 모델의 약점을 보완하던 시스템 프롬프트 구문을 80% 이상 삭제했고, 오래된 하네스를 그대로 유지하는 방식의 효율이 낮아졌다. [05:18]
  • 기존 프롬프트와 코드를 먼저 걷어낸 뒤 생모델의 반응을 관찰하고 필요한 지침만 추가하는 방식이 유리하며, 도구도 상세 예시보다 명확한 파라미터와 구조가 중요해졌다. [06:14]

5. Seedance 2.5의 장시간 영상과 제작 도구 통합

  • Seedance 2.5는 한 번의 생성으로 네이티브 30초 영상을 만들고, 인터랙티브 편집과 최대 3분 길이의 제작 파이프라인까지 지원한다. [07:54]
  • 마야·블렌더 플러그인은 3D 장면을 영상으로 변환하며, 30초 광고와 동일 조건 비교에서는 이전 버전보다 현실적인 질감과 조명 표현이 나타났다. [09:02]

6. MiniMax H3와 Imagine Video 1.5의 오픈 영상 생성 경쟁

  • MiniMax H3는 텍스트 영상 생성에서 Seedance 2.0을 넘어섰고, 영상 편집 리더보드에서는 폐쇄형 모델까지 제치며 1위를 기록한 오픈 웨이트 모델이다. [10:47]
  • 8비트 가중치를 이용한 시험에서는 RTX 3060 한 장으로 124프레임 영상을 10분 안에 생성해, 고성능 영상 모델의 로컬 실행 장벽을 낮출 가능성을 보였다. [11:07]

7. 추론형 음성 모델과 오픈 웨이트 음성 인식

  • Grok Voice Think Fast 2.0은 음성 추론, 실시간 대화, 도구 사용을 결합해 상담원이나 실시간 통화 서비스에 필요한 기능을 한 모델에서 처리한다. [12:42]
  • 음성 추론 점수는 97.2점이며 응답 속도도 빨라, 대화 역학의 소폭 열세를 감안해도 실시간 서비스 경쟁력이 높다. [13:01]

8. Gemini Robotics 2와 휴머노이드의 정교한 동작

  • Gemini Robotics 2는 포도를 지퍼백에 넣고 잠그거나 전구를 깨뜨리지 않고 돌려 빼며, 쓰레기봉투를 완전 자율로 묶는 수준의 섬세한 조작을 수행한다. [14:41]
  • 모델 구성은 비전·언어·행동을 연결하는 Robotics 2, 추론을 담당하는 ER2, 인터넷이 끊긴 환경에서도 작동하는 온디바이스 모델로 나뉜다. [15:06]

9. AI 에이전트의 작업 공유와 1인 서비스 제작

  • CTX Flow는 여러 AI 에이전트가 문서 기반 작업 맥락을 공유하게 해, 각 에이전트가 매번 처음부터 작업을 다시 시작하는 문제를 줄인다. [16:06]
  • 에이전트별 토큰 사용량을 모니터링할 수 있어 협업 상태뿐 아니라 비용과 자원 소비까지 함께 관리할 수 있다. [16:18]

🧾 결론

  • AI의 전문 추론은 답을 생성하는 단계에서 Lean 인증서처럼 결과를 검증할 수 있는 단계로 확장되고 있다.
  • 모델의 실용 가치는 가중치 성능만으로 결정되지 않으며, 하네스·시스템 프롬프트·API 가격·양자화·구동 하드웨어의 조합으로 평가해야 한다.
  • 오픈 웨이트와 가격 인하는 자체 배포 선택지를 넓히지만, 메모리 요구량과 생성 비용까지 포함한 총비용 검증이 필요하다.
  • 영상·음성·로봇·에이전트 분야에서는 단일 벤치마크보다 편집 도구, 실시간 상호작용, 온디바이스 실행, 작업 맥락 공유처럼 제작·운영 흐름과의 결합이 중요해지고 있다.

📈 투자·시사 포인트

  • 모델 공급자를 비교할 때 API 단가뿐 아니라 하네스 적용 전후 성능, 처리 속도, 프롬프트 유지 비용, 양자화별 하드웨어 요구량을 하나의 총비용표로 살펴볼 필요가 있다.
  • Astra 사례처럼 공식 검증 자료가 제공되는지, 벤치마크 조건과 결과를 독립적으로 재현할 수 있는지가 전문 AI의 신뢰도를 가르는 관찰 지표가 될 수 있다.
  • 생성형 영상에서는 순위 자체보다 장시간 생성, 인터랙티브 편집, 마야·블렌더 연동, 로컬 실행처럼 기존 제작 공정에 들어갈 수 있는지가 실용성을 좌우한다.
  • 로봇과 에이전트에서는 시연 동작의 정교함과 함께 오프라인 작동, 다양한 환경에서의 재현성, 맥락 공유, 토큰 소비 관리 능력을 지속적으로 확인해야 한다.

⚠️ 불확실하거나 확인이 필요한 부분

  • Astra가 해결했다는 10개 난제의 전체 목록, Lean 인증서 공개 범위, 독립 연구자의 재검증 결과는 제공된 내용만으로 확인할 수 없다.
  • ARC-AGI-3를 비롯한 점수와 모델 간 성능 비교에는 하네스·시스템 프롬프트·API 설정이 반영되므로 동일 조건의 생모델 성능으로 해석하기 어렵다.
  • DeepSeek-V4-Flash의 약 105분의 1 비용 비교는 요청 유형, 토큰 구성, 캐시 여부 등 세부 산정 조건이 제시되지 않았다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • Astra의 난제 목록과 Lean 인증서를 확보해 증명 전체가 기계 검증 대상인지 확인한다.
  • GPT-5.6·DeepSeek-V4-Flash 등 후보 모델을 동일 프롬프트, 동일 하네스, 동일 출력 길이로 비교하고 품질·속도·API 비용을 함께 기록한다.
  • DeepSeek-V4-Flash의 2비트·3비트·4비트 버전을 목표 하드웨어에서 시험해 메모리 사용량, 처리 속도, 품질 손실을 측정한다.
  • Seedance 2.5와 MiniMax H3에 동일한 광고 스토리보드를 적용해 생성 비용, 수정 횟수, 제작 시간, 최종 품질을 비교한다.

❓ 열린 질문

  • Astra의 검증 가능한 증명 방식은 다른 수학 분야와 실제 연구 문제에도 같은 수준으로 확장될 수 있는가?
  • 모델 지능이 높아질수록 기존 시스템 프롬프트와 하네스를 어느 시점에 제거하고 어떤 최소 지침만 다시 추가해야 하는가?
  • 오픈 웨이트 모델의 로컬 실행은 어떤 사용량과 하드웨어 조건에서 유료 API보다 실질적으로 저렴해지는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.