Articleaws.amazon.com·2026년 9월 14일·0

Abnormal AI: Amazon Bedrock AgentCore for agentic email security at scale

Quick Summary

Abnormal AI는 Amazon Bedrock AgentCore Code Interpreter의 네트워크 격리 샌드박스를 3단계 이메일 탐지와 배치 분석에 활용해, 하루 수십억 건 규모의 처리에서 어려운 사례에 에이전트 연산을 집중한다.

Abnormal AI: Amazon Bedrock AgentCore for agentic email security at scale 관련 대표 이미지

🖼️ 인포그래픽

Abnormal AI: Amazon Bedrock AgentCore for agentic email security at scale 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Abnormal AI: Amazon Bedrock AgentCore for agentic email security at scale의 핵심 내용을 4단계로 요약한 인포그래픽
Abnormal AI: Amazon Bedrock AgentCore for agentic email security at scale 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Abnormal AI는 Amazon Bedrock AgentCore Code Interpreter의 네트워크 격리 샌드박스를 3단계 이메일 탐지와 배치 분석에 활용해, 하루 수십억 건 규모의 처리에서 어려운 사례에 에이전트 연산을 집중한다.

📌 핵심 요약

  • Fortune 500 기업의 25% 이상을 보호하는 Abnormal AI는 Amazon Bedrock AgentCore Code Interpreter를 운영 환경에 도입해 이메일이 받은편지함에 도달하기 전에 위협을 분석·차단한다.
  • Code Interpreter는 완전관리형 서버리스 코드 실행 환경으로, MicroVM 세션 수명은 기본 15분부터 최대 8시간까지 설정할 수 있으며 API로 기존 에이전트 시스템에 연결된다.
  • 3단계 탐지에서 Tier 1은 경량 분류로 하루 수십억 건, Tier 2는 불확실한 사례를 대상으로 하루 수백만 건, Tier 3는 Code Interpreter를 사용하는 인라인 에이전트로 하루 수만 건의 어려운 사례를 처리한다.
  • 분석 에이전트는 주당 약 100개의 배치 작업으로 오분류와 조정 신호를 분석하고, Tier 1의 후보 휴리스틱 초안과 Tier 2 모델 개선에 활용한다. 하루에 걸친 작업에서는 상태를 파일에 저장하고 외부 연산 뒤 Code Interpreter를 다시 호출한다.
  • Abnormal AI는 재현성과 데이터 유출 방지를 위해 외부 네트워크 접근이 없는 샌드박스를 선택했다. 운영 교훈으로 가벼운 범용 에이전트 실행 구조, 연산 작업 공간, 단위·통합 테스트와 린팅을 통한 검증, 장기 작업의 파일 기반 복구 지점을 제시한다.

🧩 주요 포인트

  1. 단계별 불확실성에 따른 선별 → Tier 3에 어려운 사례만 보내 비용이 큰 에이전트 연산을 집중하고 하루 수십억 건 규모의 탐지를 지원한다.
  2. 외부 네트워크 접근 차단과 실행 검증 → 데이터 유출 억제와 재현성을 추구하면서, 에이전트의 주장보다 실제 연산·테스트 결과를 판단 근거로 삼는다.
  3. 배치 피드백과 파일 기반 상태 보존 → 오분류 분석을 Tier 1·Tier 2 개선으로 연결하고, Code Interpreter의 세션 수명을 넘어서는 작업을 이어간다.

🧠 상세 정리

1. 운영 환경의 에이전트에 필요한 연산 작업 공간

원문은 AI 에이전트가 하루 수십억 회의 작업을 수행하는 운영 환경에서, 언어적 추론을 보완할 연산 작업 공간이 반복적으로 필요해진다고 설명한다. Fortune 500 기업의 25% 이상을 보호하는 Abnormal AI는 이러한 공간으로 Amazon Bedrock AgentCore Code Interpreter를 도입해 실시간 인라인 이메일 위협 탐지를 지원한다. 이 회사는 코드 변경의 80%에 어떤 형태로든 에이전트를 활용하며, 40%는 백그라운드 에이전트가 처음부터 끝까지 작성한다고 밝힌다. 위협 탐지에 코드를 동적으로 실행하는 방식도 이처럼 AI를 개발과 운영의 중심에 두는 접근의 연장선이다. 다만 전체 이메일 처리 규모와 인라인 에이전트의 처리 규모는 구분해야 하며, 상세 구조에서는 가장 어려운 일부 사례만 에이전트가 담당한다.

2. Code Interpreter의 실행 환경과 API 통합

Amazon Bedrock AgentCore Code Interpreter는 에이전트가 코드를 동적으로 실행할 수 있는 완전관리형 서버리스 런타임이다. 임시 MicroVM 세션의 수명은 기본 15분부터 최대 8시간까지 설정할 수 있고, 세션은 호스트 운영체제 수준에서 분리된 보안 샌드박스에서 실행되도록 설계됐다. 네트워크는 샌드박스 VPC 모드나 공개 인터넷 접근을 구성할 수 있으며, 파일은 API로 최대 100MB까지 직접 처리하고 더 큰 데이터는 Amazon S3에 연결할 수 있다. Python과 Node.js 및 일반적인 시각화·통계·데이터 처리 라이브러리를 제공하고, 로그는 Amazon CloudWatch와 AWS CloudTrail로 전송한다. API로 명령 실행, 파일 업로드, 결과 회수를 제공하므로 특정 에이전트 작업 흐름을 강제하지 않고 기존 인프라에 결합할 수 있다는 점이 핵심이다.

3. 언어적 추론의 한계와 3단계 이메일 탐지

원문은 LLM이 추론과 의미적 일관성에 강하더라도 피싱 이메일 수 집계, 데이터 변환, 시각화, 생성 코드 검증에는 실제 연산이 필요하다고 설명한다. Abnormal AI는 이 연산 역량을 모든 이메일에 동일하게 적용하지 않고, 앞 단계에서 판단이 불확실한 사례를 다음 단계로 넘기는 3단계 구조를 사용한다. Tier 1은 소형 모델, 휴리스틱 규칙, 로지스틱 회귀 같은 경량 분류기로 하루 수십억 건을 처리하며, 대부분의 메시지에는 대형 모델의 비용과 깊은 분석이 불필요하다는 판단을 반영한다. Tier 2는 하루 수백만 건의 불확실한 사례에 딥러닝·머신러닝 모델을 적용해 행동 신호를 더 분석한다. Tier 3는 통상 사람 분석가의 판단이 필요한 하루 수만 건을 대상으로, 인라인 에이전트가 위협 인텔리전스와 동적으로 작성한 스크립트를 활용해 전체 행동 모델에 비춰 판정한다. 오분류는 별도 학습·개선 시스템에서 다루며, 여러 모니터링 시스템이 운영 중인 시스템을 검증한다.

4. 배치 분석 에이전트의 피드백과 장기 작업

실시간 분류 파이프라인 외에 Abnormal AI는 오분류와 조정 신호를 받아 대규모 메시지 집합의 패턴과 추세를 찾는 분석 에이전트를 운영한다. 이 에이전트는 회사 자체 탐지 파이프라인의 특징과 신호를 바탕으로 Tier 1에 사용할 후보 휴리스틱 초안을 자율적으로 작성하고 Tier 2 모델 개선에도 기여한다. 처리 규모는 주당 약 100개의 배치 작업이며, 일부 작업은 Code Interpreter 세션을 유지한 채 30분 이상 실행된다. 하루에 걸친 작업에서는 하나의 세션을 계속 유지하는 대신 Code Interpreter를 간헐적으로 사용하며 외부 작업과 연결할 수도 있다. 예를 들어 샌드박스에서 연산한 상태를 파일에 저장하고, 외부에서 모델을 학습한 뒤 Code Interpreter를 다시 호출해 결과를 처리하는 방식으로 세션 수명을 넘어서는 작업을 이어간다.

5. 외부 통신을 차단하는 샌드박스 보안 설계

Abnormal AI는 재현성과 데이터 유출 방지를 이유로 외부 네트워크 접근이 없는 샌드박스 구성을 선택했다. 외부 통신을 차단하면 세션 중 회사의 통제 밖에 있는 요소가 에이전트 행동에 영향을 주지 않도록 할 수 있으며, 회사는 이를 완전히 결정적인 환경을 지향하는 설계로 설명한다. 위협 인텔리전스를 샌드박스에 투입하더라도 프롬프트 인젝션이나 확률적 행동으로 에이전트가 악의적으로 작동할 경우 인터넷으로 데이터가 유출되지 않도록 설계했다는 주장이다. 추가로 입력 데이터의 종류와 허용되는 쓰기 동작을 통제하고, 기존 네트워크 격리 실행 구조 위에 샌드박스 격리를 더해 다층 방어를 구성한다. Code Interpreter를 기존 AWS 하위처리자 관계 안에서 사용하는 점은 규정 준수 부담을 줄이는 요소로 제시되며, 이러한 설명은 모든 위험이 제거됐다는 검증 결과와는 구분된다.

6. 운영 교훈과 적용 범위

운영 교훈의 첫째는 엄격한 단계별 절차보다 가벼운 범용 실행 구조와 상위 수준의 문제 해결 원칙을 제공할 때 에이전트가 더 잘 작동한다는 것이다. 둘째는 코드 작성 여부와 관계없이 데이터 집계, 패턴 분석, 검증을 수행하는 에이전트에 연산 작업 공간이 필요하다는 주장이다. 셋째는 단위 테스트, 통합 테스트, 린팅 같은 프로그램 기반 검증 도구를 제공해 에이전트가 최종 결과를 내기 전에 스스로 시험하도록 하는 것이다. 넷째는 장기 작업에서 파일 시스템을 복구 지점으로 사용해 외부 연산과 후속 Code Interpreter 실행을 연결하는 방식이다. 원문은 관리형 보안 샌드박스와 자체 경량 실행 구조를 결합하고 어려운 사례에 에이전트 연산을 집중하는 접근을 강조하며, 에이전트의 주장보다 실제 평가 결과를 더 신뢰하라고 권한다. 이 글은 AWS 고객인 Abnormal AI의 구현 사례와 견해를 담고 있으며, 해당 견해가 반드시 AWS의 견해를 반영하는 것은 아니라고 명시한다.

🧾 핵심 주장 / 시사점

  • 하루 수십억 건 규모를 뒷받침하는 핵심은 모든 메시지에 에이전트를 적용하는 것이 아니라, 불확실성이 높은 사례에만 깊은 분석을 배정하는 구조다.
  • 연산 작업 공간과 프로그램 기반 검증을 결합하면 언어적으로 그럴듯한 답변을 실제 계산·실행 결과로 확인할 수 있다.
  • 실시간 탐지와 배치 분석을 연결하면 어려운 사례에서 얻은 신호를 앞단의 휴리스틱과 모델 개선에 활용할 수 있다.

✅ 액션 아이템

  • Tier 1·Tier 2·Tier 3의 불확실성별 분기와 처리 규모를 기준으로 어려운 사례에 에이전트 연산을 집중하는 방식의 적용 가능성 검토.
  • 외부 네트워크 접근이 없는 샌드박스와 단위·통합 테스트 및 린팅을 함께 활용하는 보안·검증 방식 검토.
  • Code Interpreter의 최대 8시간 세션 수명을 넘어서는 작업에 파일 기반 상태 보존과 외부 연산 후 재호출 방식 적용 검토.

❓ 열린 질문

  • Tier 1·Tier 2에서 다음 단계로 넘길 불확실성의 기준은 어떻게 정하는가?
  • 외부 네트워크 접근이 없는 샌드박스의 재현성과 데이터 유출 방지 효과는 어떻게 검증하는가?
  • 주당 약 100개의 배치 작업이 만드는 후보 휴리스틱과 모델 개선의 효과는 어떻게 평가하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.