YouTube티타임즈TV·2026년 9월 28일·0

AI가 하루 넘게 혼자 알아서 일했다!

Quick Summary

영상은 AI가 사람의 개입을 최소화한 평가에서 하루 넘게 작업한 사례를 소개하며, 핵심 변화로 컴퓨터 조작의 정확도와 하나의 목표를 오래 유지하는 능력을 꼽는다.

영상 보기

클릭 전까지는 가벼운 미리보기만 먼저 불러옵니다.

원본 열기

🖼️ 인포그래픽

AI가 하루 넘게 혼자 알아서 일했다! 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

AI가 하루 넘게 혼자 알아서 일했다!의 핵심 내용을 4단계로 요약한 인포그래픽
AI가 하루 넘게 혼자 알아서 일했다! 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 결론

영상은 AI가 사람의 개입을 최소화한 평가에서 하루 넘게 작업한 사례를 소개하며, 핵심 변화로 컴퓨터 조작의 정확도와 하나의 목표를 오래 유지하는 능력을 꼽는다.

📌 핵심 요점

  1. 아스트라의 차별점은 컴퓨터 조작 자체보다 화면을 읽고 행동하는 정확도다. 영상이 제시한 스크린스팟 프로 점수는 전작 76.9%에서 92.7%로 높아졌다.
  2. 전문 프로그램 안에서 제작과 검증을 이어가는 사례가 등장한다. PCB 설계, 블렌더와 언리얼 엔진을 연결한 공간 제작, 게임 실행·수정이 대표적이다. 게임사의 수동 수정 작업이 50% 줄었다는 수치는 해당 회사의 설명이다.
  3. 장기 작업의 기준은 실행 시간이 아니라 사람이 방향을 다시 잡아주기 전까지 목표를 유지하고 실패를 수정하는 능력이다. 영상은 OS월드 성공률도 65.7%에서 72.6%로 상승했다고 전한다.
  4. 장시간 사례마다 자율성의 조건은 다르다. 낙수장 제작에는 29시간 넘게 걸렸지만 사람의 승인과 개입이 있었고, 일주일간의 도시 구현에는 여러 에이전트를 관리하는 매니저 루프가 쓰였다. 별도의 보안 평가에서는 개입을 최소화한 상태로 약 29시간 작업했다고 소개한다.
  5. 긴 작업에는 기억과 진행 방식도 중요하다. 영상은 코덱스의 작업 노트, 이전 대화·도구 기록 검색, 사용자 답변과 무관한 작업의 병행을 설명한다. 순환 깊이 기술이 장기 작업 향상의 직접 원인인지는 공식 확인되지 않았다고 덧붙인다.

🧩 배경과 문제 정의

영상은 기업용 AI 플랫폼 세미나 홍보로 시작한 뒤, 아스트라의 컴퓨터 조작과 장기 작업 능력을 본론으로 다룬다. 본론의 문제의식은 AI가 짧은 작업을 잘하더라도 화면을 잘못 읽거나 긴 작업에서 목표와 실패 이력을 놓치면 사람이 계속 방향을 바로잡아야 한다는 데 있다.

제목의 ‘하루 넘게 혼자’는 특히 사람의 개입을 최소화한 보안 평가 사례와 연결된다. 다만 영상은 다른 장시간 제작 사례에 사람의 승인이나 여러 에이전트의 관리 구조가 있었음을 구분한다. AGI 여부를 판정하기보다 실제 업무에서 무엇이 달라졌는지 설명하는 것이 영상의 초점이다.

🕒 시간순 섹션별 상세정리

1. 기업 도입의 문제 제기와 아스트라 소개

  • 도입부는 AI 에이전트의 기업 적용 병목과 데이터 문제를 언급하며, 스노우플레이크 월드투어 서울 내용을 압축한 리캡 세미나를 홍보한다. [00:21]
  • 본론에서는 전문 3D 소프트웨어와 게임을 직접 조작하는 모습을 제시하고, 영상이 GPT6 아스트라라고 부르는 모델의 변화를 살펴보겠다고 예고한다. [00:47]

2. 화면을 정확하게 읽고 전문 도구에서 작업하기

  • 엑셀 창을 열고 메뉴와 함수를 조작한 뒤 결과까지 확인하는 흐름을 보여준다. 영상이 제시한 스크린스팟 프로 점수는 전작 76.9%, 아스트라 92.7%다. [02:08]
  • 전자 회로도를 받아 키캐드에서 부품과 배선을 배치하는 PCB 사례와, 블렌더의 집 모델을 언리얼 엔진 5로 옮기는 사례를 통해 전문 도구 안팎에서 작업을 이어가는 능력을 강조한다. [03:11]
  • 게임 개발에서는 장면 수정, 실행, 직접 플레이, 오류 수정을 반복한다. 영상 속 게임사는 세 가지 프로토타입 제작에서 엔지니어의 수동 수정 작업이 50% 줄었다고 설명하며, 영상은 이를 공간 해석과 행동 정확도의 개선으로 연결한다. [04:46]

3. 장시간 작업과 실제 자율성의 차이

  • 장기 작업은 단순히 오래 켜두는 일이 아니라 목표를 유지하며 실패를 수정하는 과정이라고 정의한다. 실제 컴퓨터 업무를 평가하는 OS월드 점수는 65.7%에서 72.6%로 높아졌다고 보여준다. [06:04]
  • 낙수장을 3D로 제작한 사례는 자료 탐색, 블렌더 조작, 스크린샷 확인과 수정을 반복해 29시간 넘게 걸렸다. 영상은 중간 승인과 개입이 있어 완전히 혼자 수행한 사례는 아니라고 선을 긋는다. [06:41]
  • 일주일간 진행된 맨해튼 구현 사례에서는 매니저 역할의 AI가 일을 나누고 제작 담당 AI에 다음 작업을 넘겼다. 단일 모델을 일주일 내내 그대로 실행한 경우와는 구분된다. [07:21]

4. 하루를 넘긴 보안 평가와 장기 작업의 지원 방식

  • 출시 전 보안 평가에서는 목표·소스 코드·기본 분석 도구를 제공하고 사람의 단계별 지시를 최소화했다고 보여준다. 브라우저의 미공개 취약점을 찾고 작동하는 공격 방법을 만드는 데 약 29시간이 걸렸다는 사례를 제시한다. [08:04]
  • 같은 계산층을 반복 통과하는 순환 깊이 방식의 제한적 사용에 관한 보도를 보여준다. 다만 이 기술이 장기 작업 능력 개선의 직접적인 원인이라는 공식 확인은 없다고 명시한다. [08:39]
  • 긴 기록을 요약하면서 실패 이유가 사라지는 문제에 대응해, 코덱스에서 작업 노트와 과거 대화·도구 기록 검색을 지원한다고 보여준다. 질문이 생겨도 답변과 무관한 작업은 진행하고 중요한 결정에서만 응답을 기다리는 방식도 보여준다. [09:26]

5. 업무를 통째로 맡기기 위한 두 능력의 결합

  • 영상은 사람이 방향을 다시 잡아줘야 하는 시점이 늦어지는 것이 핵심이라고 정리한다. 화면을 보고 프로그램을 조작하는 능력과 하나의 목표를 오래 유지하는 능력이 함께 필요하다고 강조한다. [10:17]
  • 마지막에는 AGI에 가까워졌다는 논쟁을 언급하면서도, 이번 설명의 초점은 기존 AI와 비교한 실제 변화였다고 정리하고 영상을 마친다. [10:43]

🧾 결론

  • 영상이 강조하는 변화는 화면을 해석하고 행동하는 능력과 목표를 오래 유지하는 능력의 결합이다.
  • 하루 이상 작업했다는 사실만으로 완전한 무인 수행을 뜻하지는 않는다. 사람의 승인, 에이전트 구성, 평가 조건을 함께 봐야 한다.
  • 업무 위임의 실질적인 진전은 사람이 다시 개입해야 하는 시점이 늦어지고, 한 번에 맡길 수 있는 작업 범위가 넓어지는 데 있다.

📈 투자·시사 포인트

  • 업무 자동화의 가치를 평가할 때 생성 결과의 인상보다 완료율, 수동 수정량, 사람의 개입 빈도를 살펴볼 필요가 있다. 영상의 벤치마크와 게임 개발 사례가 이 관점을 뒷받침한다.
  • 전문 소프트웨어를 오가며 제작·실행·검증하는 흐름이 중요해진다. 도입 검토에서도 개별 기능 시연과 실제 업무 전체의 수행 가능성을 구분해야 한다.
  • 작업 기록 보존과 에이전트 관리 방식도 장기 업무 수행의 평가 대상이다. 영상 속 장시간 사례는 모델뿐 아니라 이를 운영하는 방식의 역할을 보여준다.
  • 영상에는 사용 비용, 수익성, 기업 실적 자료가 없다. 제시된 성능 개선만으로 특정 기업의 투자 매력이나 수익 증가를 판단하기는 어렵다.

⚠️ 불확실하거나 확인이 필요한 부분

  • 모델 명칭, 공개 시점, 벤치마크 수치와 사례는 제공된 전사의 설명에 근거한다. 원문 발표 자료와 평가 조건은 제공되지 않아 독립적으로 검증할 수 없다.
  • 낙수장 제작의 29시간, 도시 구현의 일주일, 보안 평가의 약 29시간은 사람의 개입과 에이전트 구성 조건이 다르다. 같은 수준의 자율 작업 기록으로 비교하면 안 된다.
  • 스크린스팟 프로와 OS월드의 점수는 서로 다른 평가를 가리킨다. 화면 위치 식별 성능을 실제 업무 전체의 성공률로 해석할 수는 없다.
  • 자막 기반 정리: 타임스탬프가 있는 자막을 기준으로 정리했으며, 고유명사·수치·인용은 원문 확인 필요 시 별도 검증한다.
  • 영상 속 주장: 발표자의 해석·전망·비교는 확인된 외부 사실이 아니라 영상 속 주장으로 분리해 읽는다.
  • 검증 필요: 수치, 기업 실적, 정책·시장 전망은 발행 전 최신 자료로 별도 검증이 필요하다.

✅ 액션 아이템

  • 원문 발표 자료에서 모델 명칭, 벤치마크 버전, 평가 조건과 점수를 확인한다.
  • 장시간 사례별로 사람의 승인 횟수, 수정 개입, 에이전트 수, 실제 완료 기준을 구분해 기록한다.
  • 도입하려는 업무 하나를 정해 완료율, 수동 수정 시간, 개입 빈도를 기존 방식과 비교한다.
  • 작업 노트와 이전 기록 검색이 실패한 접근의 반복을 줄이는지 확인한다.

❓ 열린 질문

  • 사람이 개입하지 않아도 되는 작업의 길이는 업무 종류와 난도에 따라 얼마나 달라질까?
  • 여러 에이전트를 관리하는 방식과 단일 에이전트의 장기 실행은 비용과 완료율에서 어떤 차이를 보일까?
  • 화면 해석, 추론 방식, 작업 기억 중 어느 요소가 장기 작업 개선에 얼마나 기여했을까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.