Articleaws.amazon.com·2026년 9월 23일·0

Agentic conversational video intelligence built on AWS

Quick Summary

AWS는 Strands Agents SDK 기반 에이전트가 질문에 따라 영상 분석 서비스를 선택하고 캐시를 재사용해 자연어 질의에 답하는 비디오 인텔리전스 구조를 제시한다.

Agentic conversational video intelligence built on AWS 관련 대표 이미지

🖼️ 인포그래픽

Agentic conversational video intelligence built on AWS 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Agentic conversational video intelligence built on AWS의 핵심 내용을 4단계로 요약한 인포그래픽
Agentic conversational video intelligence built on AWS 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

AWS는 Strands Agents SDK 기반 에이전트가 질문에 따라 영상 분석 서비스를 선택하고 캐시를 재사용해 자연어 질의에 답하는 비디오 인텔리전스 구조를 제시한다.

📌 핵심 요약

  • Strands Agents SDK와 Amazon Bedrock 기반 에이전트가 질문의 의도를 해석해 Amazon Transcribe, Amazon Rekognition 또는 Amazon Bedrock Data Automation(BDA)을 선택하고 분석 결과를 답변으로 종합한다.
  • 60분 영상 테스트에서 첫 분석은 일반적으로 5~10분, 이미 분석한 동일 콘텐츠의 후속 질문은 캐시 재사용으로 1초 미만이 걸렸으며, 실제 시간은 영상 길이·해상도·호출 서비스에 따라 달라진다.
  • 한 대형 미디어·엔터테인먼트 기업은 200개가 넘는 수 시간 길이 녹화물에서 수동 검토 시간을 약 80% 줄였다고 보고했으나, 이는 고객 내부의 녹화물당 분석가 작업 시간 전후 비교이며 독립 검증되지 않았다.
  • Amazon S3는 업로드 영상과 분석 결과를 사용자별 접두사로 저장하고, 에이전트는 대화 이력과 캐시를 활용해 후속 질문에 대응한다. BDA는 영상 요약·챕터 감지·전체 전사를 단일 API 호출로 제공하는 대안이다.
  • 운영 프롬프트의 축약 예시는 24시간 미만 캐시 재사용, 명시적 재분석 요청 시 캐시 우회, 서비스 실패 시 대체 경로, Amazon Rekognition 신뢰도 60% 미만일 때 불확실성 보고를 제시한다. 운영 배포에는 특히 얼굴 매칭·감시 용도에서 Amazon Bedrock Guardrails 추가를 권고한다.

🧩 주요 포인트

  1. 질문별 서비스 선택 → 고정 파이프라인 대신 필요한 분석을 실행하며, 도구 설명을 기반으로 기능을 확장하는 구조다.
  2. 초기 분석 5~10분과 캐시 기반 후속 응답 1초 미만 → 첫 처리와 반복 질의의 성능을 구분해야 하며, 약 80%의 검토 시간 절감도 고객 내부 측정이라는 한계와 함께 해석해야 한다.
  3. 캐시 유효성·서비스 대체 경로·낮은 신뢰도 보고·Amazon Bedrock Guardrails → 응답 속도뿐 아니라 결과의 최신성, 실패 대응, 불확실성 전달이 운영 설계의 핵심이다.

🧠 상세 정리

1. 영상 축적과 기존 분석 방식의 부담

원문은 미디어, 보안, 보험, 전문 서비스 조직에서 사람이 검토할 수 있는 양보다 더 많은 영상이 생성되고 있다는 문제로 시작한다. 회의 녹화는 공유 드라이브에 쌓이고, 보안 카메라 영상은 수 주간 검토되지 않으며, 현장 점검 영상은 초기 검토 이후에도 객체 스토리지에 남는다. 이 영상에는 과거 설계 결정, 특정 인물의 도착 시점, 차량 충돌에 이르는 사건 순서처럼 유용한 정보가 있지만, 이를 찾으려면 전통적으로 장시간 영상을 직접 시청해야 했다. 질문 유형별로 맞춤형 머신러닝 파이프라인을 만드는 대안도 회의 질의용 전사, 시각 검색용 컴퓨터 비전, 얼굴 매칭 연동을 각각 개발해야 하므로 새로운 활용 사례마다 개발 부담이 생긴다는 것이 출발점이다.

2. 질문에 따라 분석 경로를 정하는 접근

제안된 해법은 Strands Agents SDK로 만든 단일 AI 에이전트가 사용자의 자연어 질문에 맞춰 AWS 서비스를 실행 시점에 선택하는 구조다. 예를 들어 90분 회의 녹화를 올린 사용자는 회의에서 내려진 결정이나 예산 일정 언급 여부를 질문할 수 있고, 에이전트는 전사와 시각 분석 중 무엇이 필요한지 판단해 답변을 종합한다. 같은 시스템은 특정 인물이 보안 영상에 등장했는지, 영상의 첫 30분에 어떤 내용이 있는지, 충돌 전에 어느 차량이 차선을 변경했는지도 질의 대상으로 삼는다. 인터페이스는 대화 패널과 파일 업로드·분석 모드 선택용 사이드바를 제공하며, 핵심은 활용 사례마다 별도 처리 파이프라인을 만드는 대신 모델이 질문에 맞는 도구를 선택한다는 점이다.

3. 고객 적용 결과와 성능 수치의 범위

한 대형 미디어·엔터테인먼트 기업은 AWS Professional Services 참여 과정에서 이 접근을 채택해 녹화된 사전 조사 세션에서 설계 결정, 실행 항목, 이해관계자의 입장을 추출했다. 원문에 따르면 200개가 넘는 수 시간 길이 녹화물의 누적분을 대상으로 수동 검토 시간이 약 80% 감소했지만, 이 수치는 고객이 녹화물당 분석가 작업 시간을 내부적으로 전후 비교한 결과이며 독립적으로 검증되지 않았다. 응답 시간도 최초 처리와 후속 질문을 구분해야 하는데, 60분 영상 테스트에서 첫 질문은 전사나 시각 분석 때문에 일반적으로 5~10분이 걸렸다. 이미 분석한 동일 콘텐츠에 대한 후속 질문은 캐시 재사용으로 1초 미만에 응답했으며, 실제 소요 시간은 영상 길이와 해상도, 호출되는 AWS 서비스에 따라 달라진다.

4. 구성 요소와 구현 전제

아키텍처의 중심은 Strands Agents SDK와 Amazon Bedrock으로 구성한 오케스트레이터이며, Claude Sonnet 또는 도구 사용을 지원하는 다른 대규모 언어 모델이 추론 엔진 역할을 한다. 이 에이전트는 질문을 받아 도구를 고르고, 필요하면 여러 서비스 호출을 순서대로 연결하며, 결과를 대화형 응답으로 종합하고 대화 이력을 유지한다. Amazon S3는 업로드 영상과 캐시된 분석 결과를 저장하며, 원문은 다중 테넌트 격리를 위해 사용자별 접두사를 사용한다고 설명한다. 구현 전제로는 Anthropic Claude Sonnet이 활성화된 Amazon Bedrock과 Amazon S3 접근 권한, BDA 또는 Amazon Rekognition·Amazon Transcribe, Python 3.11 이상과 Strands Agents SDK가 제시된다. 또한 해당 서비스의 IAM 권한으로 설정된 AWS CLI와 도구 사용·추론 루프 같은 AI 에이전트 개념에 대한 기본 이해가 필요하다.

5. 분석 서비스별 역할과 대안 경로

Amazon Rekognition은 영상 프레임의 객체, 장면, 활동, 얼굴을 감지하는 시각 분석을 제공하며, 에이전트는 화면에 보이는 대상과 관련된 질문에 이 서비스를 사용한다. Amazon Transcribe는 발화 내용을 텍스트로 변환하고 100개가 넘는 언어의 자동 감지와 화자 분리를 지원하므로, 대화나 발언 내용에 관한 질문의 분석 경로가 된다. Amazon Bedrock Data Automation(BDA)은 영상 요약, 챕터 감지, 전체 전사를 하나의 API 호출로 결합해 포괄적인 분석을 한 번에 수행하거나 Rekognition 또는 Transcribe를 사용할 수 없을 때 대안으로 활용된다. 원문은 이 서비스들을 고정된 전체 목록이 아닌 출발점으로 규정하며, 운영 배포에서는 특히 얼굴 매칭과 감시 활용 사례의 콘텐츠 필터링 및 근거 확인을 위해 Amazon Bedrock Guardrails를 추가하도록 권고한다.

6. 질의 처리 순서와 캐시 재사용

기존 고정 파이프라인은 영상을 업로드한 뒤 전사와 시각 분석을 모두 수행하고 결과를 제시하므로, 질문의 성격과 무관하게 같은 단계를 거치고 사용자는 전체 처리가 끝날 때까지 기다린다. 에이전트 방식은 사전 처리를 S3 버킷 업로드 수준으로 최소화하고, 각 질문이 전사 요약인지 시각 검색인지 얼굴 매칭인지 먼저 해석한다. 이어 필요한 분석이 이미 수행되어 캐시에 있는지 확인하고, 결과가 없으면 적절한 도구를 선택해 실행하며 한 도구의 출력이 다른 도구의 입력이 되는 경우에는 순차 호출한다. 분석이 끝나면 결과를 자연어 답변으로 결합하고, 대화 이력과 기존 분석을 후속 질문에 활용한다. 따라서 원문에서 제시한 빠른 후속 응답은 새 영상의 분석 자체가 즉시 끝난다는 뜻이 아니라, 앞서 처리한 결과를 재사용하는 방식에 기반한다.

7. 프롬프트에 담긴 운영 정책

설정 예시는 Amazon Bedrock의 Claude Sonnet 4.5 모델 식별자와 최대 출력 토큰 4096을 지정하고, 질문의 분석 유형 판단, 캐시 확인, 도구 호출, 타임스탬프를 포함한 답변 종합을 시스템 프롬프트에 담는다. 실제 운영 프롬프트는 소스 기준 약 250줄이며, 제시된 축약 예시는 분석 전에 캐시를 확인해 24시간 미만의 결과를 사용하되 사용자가 재분석이나 새 분석을 요구하면 캐시를 우회하고 새 결과를 저장하도록 설명한다. 실패 대응에서는 Transcribe 실패 시 BDA를 대안으로 제안하고, Rekognition 신뢰도가 60% 미만이면 불확실성을 알리며, BDA 시간 초과 시 개별 Transcribe와 Rekognition 호출로 전환한다. 음성과 시각 이해가 모두 필요한 질문은 가능하면 두 서비스를 병렬 실행하고 타임스탬프를 맞춰 통합하며, 각 주장에 구체적인 시점을 인용하도록 한다. 나머지 운영 프롬프트는 파일 선택, 접근 거부 대체 처리, 다중 파일 응답 통합, 정리 작업 전 확인, 범위 및 업로드 진행 관련 제약 등도 다룬다.

8. 도구 정의를 통한 확장과 제공 자료의 경계

각 AWS 서비스는 Python 함수에 @tool 데코레이터를 붙여 에이전트에 노출되며, 함수 시그니처가 매개변수를 정의하고 문서 문자열이 언제 어떤 방식으로 사용할지 설명한다. 원문은 이 문서 문자열을 에이전트의 도구 사용 설명서로 강조하고, search_faces_in_video 예시에서 영상의 S3 키, 컬렉션 식별자, 기본값 80.0의 신뢰도 임계값을 매개변수로 제시한다. 화면 속 텍스트 감지 같은 기능을 추가하려면 새로운 도구 함수를 정의해 도구 목록에 넣으면 되며, 별도의 워크플로 로직 변경이 필요 없다는 것이 설명의 핵심이다. 원문은 전체 구현과 나머지 도구를 동반 GitHub 저장소에서 제공한다고 안내하지만, 제공된 본문은 얼굴 검색 도구의 문서 문자열 중간에서 끝난다. 따라서 이 자료만으로는 해당 함수의 후속 구현이나 이후 절의 상세 동작을 확인할 수 없으며, 확장성에 대한 정리는 앞서 명시된 도구 선택 구조에 한정된다.

🧾 핵심 주장 / 시사점

  • 자연어 질의의 편의성과 최초 분석 지연은 함께 존재한다. 1초 미만 응답의 핵심 조건은 이미 분석된 콘텐츠와 관련 캐시의 재사용이다.
  • 워크플로 선택을 모델이 담당하므로 도구 설명과 프롬프트의 캐시·실패 대응 정책이 실제 서비스 동작을 결정하는 중요한 요소가 된다.
  • 약 80%의 수동 검토 시간 감소는 활용 가능성을 보여주는 고객 사례이지만, 독립 검증되지 않은 내부 비교이므로 다른 환경의 성과를 보장하는 수치로 해석할 수 없다.

✅ 액션 아이템

  • 초기 분석 5~10분과 캐시 기반 후속 응답 1초 미만을 구분해 응답 성능을 평가한다.
  • 약 80%의 수동 검토 시간 절감은 고객 내부 측정이며 독립 검증되지 않았다는 조건과 함께 활용 효과를 검토한다.
  • 24시간 미만 캐시 재사용, 명시적 재분석, 서비스 대체 경로와 Amazon Bedrock Guardrails 권고를 운영 설계에 반영할지 검토한다.

❓ 열린 질문

  • 영상 길이·해상도·호출 서비스가 달라질 때 초기 분석 5~10분과 후속 응답 1초 미만은 어떻게 달라지는가?
  • 독립 검증되지 않은 약 80%의 수동 검토 시간 절감은 다른 영상과 질문에서도 재현되는가?
  • 24시간 미만 캐시 재사용과 명시적 재분석 요청은 결과의 최신성 요구를 충족하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.