YouTube조코딩 JoCoding·2026년 8월 31일·0

AI뉴스 - Astra, AGI 올해 달성, Fable 5.1, 할라피뇨, 넥토리얼, GLM-5.3, 실시간 H3, Gemini Omni 1.1 등

Quick Summary

Astra와 AGI 전망부터 GLM 5.3, Gemini Omni 1.1, 실시간 H3까지 이번 AI 뉴스는 경쟁의 중심이 모델 성능에서 장기 실행 에이전트·추론 칩·실시간 영상·서비스 자동화로 빠르게 확장되고 있음을 보여준다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

AI뉴스 - Astra, AGI 올해 달성, Fable 5.1, 할라피뇨, 넥토리얼, GLM-5.3, 실시간 H3, Gemini Omni 1.1 등 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

AI뉴스 - Astra, AGI 올해 달성, Fable 5.1, 할라피뇨, 넥토리얼, GLM-5.3, 실시간 H3, Gemini Omni 1.1 등의 핵심 내용을 4단계로 요약한 인포그래픽
AI뉴스 - Astra, AGI 올해 달성, Fable 5.1, 할라피뇨, 넥토리얼, GLM-5.3, 실시간 H3, Gemini Omni 1.1 등 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

Astra와 AGI 전망부터 GLM-5.3, Gemini Omni 1.1, 실시간 H3까지 이번 AI 뉴스는 경쟁의 중심이 모델 성능에서 장기 실행 에이전트·추론 칩·실시간 영상·서비스 자동화로 빠르게 확장되고 있음을 보여준다.

📌 핵심 요점

  1. Astra는 여러 에이전트가 수학 증명, 데이터 분석, 데스크톱 조작을 수행하며 며칠 또는 몇 주 동안 작동하는 장기 실행 모델로 알려졌고, OpenAI는 2026년 말까지 경제적 가치가 큰 작업 대부분에서 인간을 능가하는 자율 시스템을 내부적으로 구축하겠다는 AGI 목표를 제시했다.
  2. OpenAI와 Broadcom의 ‘할라피뇨’ 추론 칩, 중국산 칩으로 처리된 GLM-5.3 Flash 트래픽, Nvidia의 Hugging Face 인수 소식은 모델뿐 아니라 칩·배포·유료 추론을 아우르는 수직 통합 경쟁이 심화되고 있음을 시사한다.
  3. GLM-5.3 Flash와 Qwen 계열은 비교적 효율적인 구조와 양자화 실행 가능성을 앞세워 폐쇄형 모델과의 격차를 좁히고 있다. DeepSeek의 API·B2B 매출 사례는 오픈 웨이트 배포와 상업적 수익화가 양립할 수 있다는 근거도 제시한다.
  4. Gemini Omni 1.1 Flash와 MiniMax H3는 영상의 캐릭터·조명·서사를 이어 가거나 재생 속도보다 빠르게 영상을 생성한다. 광고 제작 자동화와 시청자 반응형 무한 스트리밍이 기술 시연을 넘어 실제 서비스 형태로 연결될 가능성이 커졌다.
  5. AI는 이벤트 기반 업무 실행, 결제·통화, 개발자 채용, 실시간 전사, 로봇 원샷 학습까지 확장되고 있다. 동시에 무검열 모델, 소스 코드와 학습 데이터 유출, 사용량 제한처럼 성능 향상만으로 해결되지 않는 운영·보안 문제가 핵심 제약으로 부상했다.

🧩 배경과 문제 정의

  • 차세대 프런티어 모델과 오픈 웨이트 모델의 성능 격차가 빠르게 좁아지면서 모델·반도체·추론 인프라 경쟁이 동시에 격화되고 있다.
  • AI가 코드 작성과 콘텐츠 생성을 넘어 장기 실행 에이전트, 실시간 영상, 결제·통화·업무 자동화로 확장되면서 기존 서비스와 채용 방식도 달라지고 있다.
  • 모델의 사용 한도, 무검열 모델의 위험성, 데이터·소스 코드 유출처럼 성능 향상만으로 해결되지 않는 운영·보안 문제도 커지고 있다.
  • 로봇과 개인 개발 사례에서는 한 번의 시연이나 AI 도구만으로 새로운 기술을 구현하는 흐름이 나타나며, 인간의 작업 방식과 학습 진입 장벽까지 바꾸고 있다.

🕒 시간순 섹션별 상세정리

1. Astra의 장기 실행 에이전트와 OpenAI의 AGI 전망

  • 코드명 Ultima Alpha Astra는 GPT Image 2와 함께 더 넓게 배포될 가능성이 있으며, 한 번의 프롬프트로 GTA 1 클론과 고품질 3D 우주선·성 등을 구현한 사용 사례가 포착됐다. [00:06]
  • Astra는 여러 에이전트가 수학 증명과 데이터 분석을 수행하고 데스크톱 소프트웨어를 빠르게 조작하면서 며칠 또는 몇 주 동안 계속 작동하도록 설계된 모델로 알려졌다. [01:04]

2. 자체 추론 칩과 이벤트 기반 업무 자동화

  • OpenAI와 Broadcom이 공동 설계한 ‘할라피뇨’ 추론 칩은 여러 오픈 모델 처리에서 Nvidia Blackwell과 차세대 Rubin 공개 결과를 앞선 것으로 전해져 자체 반도체 경쟁력을 드러냈다. [02:54]
  • ChatGPT 작업 기능은 정해진 시간에 실행하는 예약 방식에서 Slack·Gmail·GitHub 등의 변경을 감지하는 이벤트 기반 트리거로 확장됐으며, 무료 사용자도 기본 스케줄링 작업을 사용할 수 있게 됐다. [03:24]

3. Claude 5.1 시험과 개발자 사용량 경쟁

  • Claude Fable 5 사용자 일부가 Fable 5.1로 라우팅되는 정황이 나타나면서 Anthropic이 정식 출시 전 트래픽 실험을 진행 중일 가능성이 커졌다. [04:29]
  • Claude Code의 한도는 기존 이벤트 기간보다 실질적으로 약 17% 감소해 불만을 낳은 반면, OpenAI는 Codex와 유료 사용자 할당량을 재설정하고 버그 수정으로 동일 할당량의 지속 시간을 10~50% 늘렸다. [04:51]

4. GLM-5.3의 프런티어급 성능과 로컬 실행

  • GLM-5.3 Flash는 총 320B·활성 18B 파라미터의 비교적 작은 구조로 이전 GLM-5.2를 넘고 일부 평가에서 상위 폐쇄형 모델과 비슷한 수준에 도달해 저비용 추론 경쟁력을 확보했다. [06:13]
  • 양자화 버전은 약 100GB VRAM 환경이나 MacBook·DGX Spark에서도 실행할 수 있지만, 검열을 해제한 파생 모델은 보안 연구에 유용한 동시에 무기·해킹 정보까지 제한 없이 생성할 위험이 있다. [07:36]

5. 중국산 AI 칩과 연속되는 오픈 웨이트 공세

  • GLM-5.3 Flash의 OpenRouter 트래픽은 중국산 AI 칩으로 처리됐으며, 하루 100조 토큰을 무료로 제공할 수 있다는 수치는 중국 내 대규모 추론 인프라의 존재를 보여준다. [08:35]
  • Tencent Hunyuan 계열의 대형 모델과 Qwen 3.8 Flash Next가 오픈 웨이트로 이어졌고, Qwen 모델은 차세대 Qwen 4 아키텍처의 초기 프리뷰를 180B 규모로 공개해 소비자 환경의 양자화 실행 가능성도 남겼다. [09:13]

6. 오픈 모델의 수익성과 Hugging Face의 전략적 가치

  • DeepSeek는 오픈 웨이트 배포와 별도로 API·B2B 공급으로 1월부터 7월까지 약 970억 원의 매출과 82.9%의 매출총이익률을 기록해 공개 모델도 수익 사업이 될 수 있음을 보여줬다. [10:15]
  • Nvidia의 Hugging Face 인수 소식은 모델 저장소와 GPU 즉시 배포 기능을 결합해, 오픈 모델 공개부터 유료 추론 인프라 판매까지 직접 연결하려는 전략으로 읽힌다. [11:13]

7. Gemini Omni의 영상 연속성과 광고 제작 통합

  • Gemini Omni 1.1 Flash는 이전 영상의 최대 10초를 분석해 캐릭터 정체성·조명·서사를 유지하며 영상을 연장하고, 첫·마지막 프레임 연결과 360p 미리보기 후 4K 업스케일을 지원한다. [12:18]
  • Google Ads는 브랜드 이미지와 콘셉트를 바탕으로 광고 영상을 생성하고 YouTube·Google 캠페인으로 바로 내보내는 흐름을 통합했으며, Gemini 3.8 Flash와 음성 기반 Spark 작업도 준비 중이다. [13:34]

8. 넥토리얼의 AI 중심 게임 개발자 채용

  • 넥슨의 넥토리얼은 정규직 수준의 급여·복지와 맞춤형 교육을 제공하는 채용 연계형 인턴십이며, 2026년에는 게임 프로그래머 모집에 집중한다. [14:44]
  • 기존 알고리즘 코딩 테스트를 폐지하고 모든 서류 지원자에게 AI 면접을 제공한 뒤 AI 도구를 활용한 문제 해결력을 별도로 평가하며, 입사 의사 없는 전형 체험 목적 지원에는 불이익이 생길 수 있다. [15:38]

9. H3의 실시간 초과 영상 생성과 무한 스트리밍

  • MiniMax H3는 B200 GPU 네 장에서 15초 영상을 약 13초 만에 만들 수 있으며, fal.ai의 H3 Max는 평균 3.49초 만에 5초 영상을 생성해 재생 속도보다 생성 속도가 빨라졌다. [17:41]
  • 빠른 생성 속도를 Twitch 방송과 채팅 입력에 연결하면 시청자 반응을 반영한 영상을 끝없이 송출할 수 있으며, 실제 사이트와 무료 API 데모에서도 약 3초 생성 사례가 확인됐다. [18:37]

10. Grok 컴패니언 이전과 OpenAI 모델 제휴 종료

  • Grok의 컴패니언 기능은 9월 1일 이후 종료되고 캐릭터들이 별도 Animates 서비스로 이동하면서, X 내부 기능이었던 AI 연애·캐릭터 채팅 사업이 독립 서비스로 분리됐다. [19:31]
  • SpaceX에 인수된 Cursor는 OpenAI와의 파트너십을 종료했으며, XAI가 OpenAI 데이터를 증류해 자체 모델을 훈련했다는 우려가 배경으로 추정돼 Cursor 내 OpenAI 모델 사용이 제한될 가능성이 생겼다. [20:34]

11. 결제·통화 에이전트와 소스 유출 위험

  • Grokbot은 Stripe Link를 연결해 카드 번호를 직접 전달하지 않고 미국 사용자의 쇼핑 결제를 완료할 수 있으며, 음성 통화 기능까지 추가되면 전화 예약도 자체적으로 처리할 수 있다. [21:21]
  • Grokbot 구현 소스와 Suno AI의 기술 스택·수집 데이터가 유출되면서 에이전트 코드 보안과 학습 데이터 출처가 동시에 위험 요소로 떠올랐다. [22:12]

12. 다국어 실시간 전사와 발화 수정 정리

  • Gemini 3.5 Transcribe는 여러 언어가 섞여 빠르게 전환되는 음성도 실시간에 가깝게 텍스트로 변환하며, 노트 앱과 음성 인터페이스에 적용할 수 있는 정확도와 지연 시간을 제공한다. [23:45]
  • 스마트 모드는 주문 내용을 말하다가 옵션이나 크기를 번복해도 중간의 실수와 수정 발화를 제거하고 최종 의도만 반영한 문장으로 정리한다. [24:30]

13. 로컬 AI 하드웨어와 국내 모델 개발의 변화

  • Apple의 M6는 최초의 2나노 칩으로 공개됐고, M5 Ultra 기반 Mac Studio는 최대 512GB 통합 메모리로 대형 로컬 모델을 올릴 수 있는 하드웨어 선택지를 넓혔다. [25:16]
  • 독자 AI 파운데이션 모델 평가에서는 벤치마크 1위였던 Motif가 전문가·사용자 평가에서 낮은 점수를 받아 탈락하면서 정량 성능과 실제 사용 평가의 비중을 둘러싼 이견이 생겼다. [26:00]

14. 로봇이 발견한 움직임과 Optimus의 진척

  • 로봇 올림픽에서 강화학습으로 최적화된 독특한 달리기 자세가 우승으로 이어졌으며, 인간의 기존 자세보다 공기 저항과 이동 효율 측면에서 나을 가능성이 제기됐다. [27:30]
  • 높이뛰기의 포스베리 플롭처럼 낯선 동작이 더 높은 성능으로 새로운 표준이 될 수 있으며, 로봇 학습도 인간이 당연하게 여긴 운동 방법을 다시 탐색하게 만든다. [27:56]

15. 한 번의 영상으로 배우는 S1 로봇 기초 모델

  • Skild AI의 S1은 단 하나의 시연 영상만으로 처음 보는 최대 10분 길이의 작업을 학습하는 원샷 로봇 기초 모델로, 반복적인 데이터 수집과 작업별 재학습 부담을 줄인다. [29:18]
  • 조리 재료를 뒤집거나 원두와 뜨거운 물을 다루는 과정을 한 번 본 뒤 그대로 수행해, 복잡한 연속 행동도 단일 비디오 프롬프트만으로 습득할 가능성을 보여준다. [29:54]

16. 로봇 학습과 기업 AX 정착 조건

  • 원두를 숟가락으로 붓는 시범을 로봇이 수행했으며, 향후 인간이 직접 동작을 보여주는 방식으로 새로운 기술을 계속 가르칠 수 있다. [30:00]
  • AX 정착 조직의 93.9%는 경영진이 전환을 직접 주도했으며, 일회성 AI 특강을 넘어 예산 지원과 데이터 통합까지 이어져야 실질적인 변화가 가능하다. [30:35]

17. 과거의 선택을 탐색하는 앱과 서비스 제작

  • 이번 주 1위 제품은 과거의 특정 시점으로 돌아가 당시의 미래 사주를 확인하는 앱으로, 다른 선택을 했다면 결과가 어떻게 달라졌을지 탐색할 수 있다. [31:17]
  • 후회되는 선택의 대안을 생각해 보는 경험을 제공하며, 유사한 서비스를 직접 만들려면 바이브 코딩 기반 1인 창업 콘텐츠를 활용할 수 있다. [31:31]

🧾 결론

  • 이번 소식의 공통점은 AI가 질문에 답하는 도구에서 장시간 작업하고 외부 서비스를 조작하며 거래까지 완료하는 실행 주체로 이동하고 있다는 점이다.
  • 오픈 웨이트 모델의 효율 개선과 로컬 실행 가능성은 폐쇄형 모델의 독점력을 약화시키지만, 실제 경쟁력은 칩 공급·배포 채널·API 사업·개발자 생태계까지 결합해야 완성된다.
  • 실시간보다 빠른 영상 생성과 단일 시연 기반 로봇 학습은 콘텐츠와 물리적 작업 모두에서 제작 비용과 진입 장벽을 낮출 수 있다.
  • AGI 달성 전망이나 개별 벤치마크보다 중요한 판단 기준은 장기 작업의 안정성, 실제 비용, 보안 통제, 서비스 통합 수준이다.

📈 투자·시사 포인트

  • 추론 수요가 확대될수록 GPU 제조사뿐 아니라 자체 추론 칩, 메모리, 네트워크, 모델 저장소와 배포 플랫폼을 연결하는 기업의 전략적 가치가 커질 수 있다.
  • 오픈 모델 사업은 무료 공개 자체보다 API·B2B 공급, 호스팅, 최적화된 추론 인프라에서 수익을 회수하는 구조로 평가해야 한다.
  • 실시간 영상 생성은 광고·게임·라이브 방송 시장의 제작 단가를 낮출 수 있지만, 차별화 요소는 생성 속도보다 캐릭터 연속성, 제어 가능성, 유통 채널 통합에 있을 가능성이 높다.
  • 기업의 AX 성과는 모델 도입 여부보다 경영진 주도, 예산, 데이터 통합, 보안 체계가 함께 작동하는지에 좌우될 수 있다.

⚠️ 불확실하거나 확인이 필요한 부분

  • Astra의 배포 범위와 장기 실행 성능, Fable 5.1의 트래픽 시험, 비공개 Optimus 영상은 공식 출시나 독립적인 검증이 완료된 사실로 단정하기 어렵다.
  • OpenAI의 2026년 말 AGI 목표는 내부 구축 전망이지 AGI 달성 사실이 아니며, ‘경제적 가치가 큰 작업 대부분’의 범위와 평가 기준도 확인이 필요하다.
  • ‘할라피뇨’ 칩과 GLM-5.3 Flash의 비교 결과는 모델, 정밀도, 배치 크기, 비용, 전력 조건이 동일한지 제시되지 않아 공개 수치만으로 우위를 일반화하기 어렵다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 장기 실행 에이전트를 평가할 때 단일 데모 대신 24시간 이상 작업 성공률, 오류 복구, 권한 통제, 실행 비용을 함께 측정한다.
  • GLM-5.3 Flash 등 오픈 웨이트 모델은 동일 데이터와 하드웨어 조건에서 품질·지연 시간·메모리·토큰당 비용을 폐쇄형 모델과 비교한다.
  • 결제·메일·코드 저장소와 연결되는 에이전트에는 최소 권한, 승인 단계, 비밀정보 격리, 감사 로그, 즉시 중단 기능을 적용한다.
  • 실시간 영상 서비스를 검토할 때 생성 속도 외에 장면 연속성, 저작권, 안전 필터, 스트리밍 비용과 시청자 입력 악용 가능성을 점검한다.

❓ 열린 질문

  • 장기 실행 에이전트가 며칠 동안 자율적으로 작동할 때 오류 누적과 권한 오남용을 어떤 방식으로 제한할 수 있을까?
  • 오픈 웨이트 모델의 성능 격차가 계속 줄어들면 모델 자체보다 칩·호스팅·배포 채널이 더 강한 수익 방어선을 형성할까?
  • 실시간보다 빠른 영상 생성이 보편화되면 라이브 방송과 광고에서 인간 제작자의 역할은 기획·검수 중심으로 재편될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.