AI Security Is an Engineering Problem — How to Solve It at Every Layer of the Agent Stack
Quick Summary
NVIDIA는 AI 보안을 엔지니어링 문제로 규정하고, 에이전트 전체 스택에 강제 가능한 보안 경계, 명확한 책임자, 보호 기능의 효과를 입증하는 증거가 필요하다고 강조한다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
NVIDIA는 AI 보안을 엔지니어링 문제로 규정하고, 에이전트 전체 스택에 강제 가능한 보안 경계, 명확한 책임자, 보호 기능의 효과를 입증하는 증거가 필요하다고 강조한다.
📌 핵심 요약
- AI 에이전트는 추론·도구 사용·상황 적응 능력을 갖추지만, 신원 확인·접근 통제·노출 제한·보호 기능 검증이라는 기존 보안 원칙은 모델, 하네스, 런타임 전반에 계속 적용돼야 한다.
- 런타임은 에이전트의 판단과 독립적으로 파일·네트워크·프로세스 접근을 제한해야 한다. 에이전트에는 추적 가능한 신원과 작업 범위로 제한된 자격 증명을 부여하고, 중대한 작업과 권한 변경에는 사람의 승인을 요구해야 한다.
- NVIDIA OpenShell은 에이전트가 통제할 수 없는 위치에서 정책을 집행하는 오픈소스 보안 런타임이다. Cisco의 DefenseClaw는 거버넌스 계층을 추가하고, JFrog는 OpenShell과 통합해 스킬 검사·검증 및 접근 정책 집행을 지원한다.
- 배포 전에는 범위 밖 자격 증명 획득, 민감 데이터 무단 전송, 권한 변경, 모니터링 방해 시도를 통제가 차단하는지 검증해야 한다. 모델·도구·워크플로의 중대한 변경 후에는 테스트를 반복하고, 명확히 지정된 책임자가 결과에 따라 배포 여부와 시정 조치를 판단해야 한다.
- 폐쇄형 모델의 관리형 기능과 개방형 모델의 검사·조정·자체 인프라 운영 선택지는 상호 보완적이다. 방어용 AI의 가치는 재현 가능한 발견, 검증 가능한 수정, 대응 시간 단축으로 평가하며, NVIDIA의 보안 연구와 Open Secure AI Alliance는 실패·통제·수정 검증에 관한 증거 공유를 지원한다.
🧩 주요 포인트
- 모델·하네스·런타임이 역할을 나눔 → 보안 책임도 전체 스택에 배치하고, 에이전트의 잘못된 판단에도 유지되는 경계를 마련해야 함.
- 공격 시도와 변경 이후의 반복 테스트 → 배포 판단을 보호 효과의 증거에 연결하고, 발견된 실패를 향후에도 반복 실행할 수 있는 검증으로 전환해야 함.
- 개방형·폐쇄형 모델의 상호 보완성과 보안 증거 공유 → 방어자가 환경에 맞는 도구를 선택하고, 다른 팀의 검증 결과를 활용해 방어 수준을 높일 수 있음.
🧠 상세 정리
1. 기술 변화 속에서도 유지되는 보안 원칙
글은 AI 보안을 명확한 요구사항, 강제 가능한 통제, 지정된 책임자, 보호 효과를 입증하는 증거가 필요한 엔지니어링 문제로 규정한다. 인터넷과 클라우드가 소프트웨어의 운영 방식을 바꿨을 때도 신원 확인, 접근 통제, 노출 제한, 보호 기능 검증이라는 핵심 책임은 유지됐다. AI 에이전트는 추론하고 도구를 사용하며 접한 데이터에 따라 행동을 조정하므로, 기존 원칙을 새로운 운영 조건에 적용해야 한다. 조직은 AI의 생산성 혜택을 원하지만 이를 관리하고 보호하는 관행은 아직 발전 중이어서 도입 속도가 부담을 만든다. 따라서 AI 역량이 커지는 만큼 보안 엔지니어링을 가속하고 방어 도구에 대한 접근과 효과적인 방법의 공유를 확대해야 한다는 것이 글의 출발점이다.
2. 전체 에이전트 스택에 걸친 책임과 권한 분리
애플리케이션은 코드, 데이터, 신원, 서비스, 인프라가 함께 작동하는 시스템이며 AI 에이전트는 이 시스템을 확장한다. 모델은 능력을 제공하고, 하네스는 문맥·도구·워크플로를 조직하며, 런타임은 실제 행동이 실행되는 인프라를 제공하므로 각 계층에 보안 책임이 있다. 글은 고객 기록을 수정하던 에이전트가 첨부 문서의 악성 지시를 접하고 고객 데이터를 허가되지 않은 목적지로 내보내려는 사례를 제시한다. 이때 네트워크 정책은 전송을 차단하고, 보호된 로그는 도구 호출 시도와 권한 판단, 결과를 기록해 사용된 도구와 접근하려던 목적지를 확인할 수 있어야 한다. 고객 기록 수정 권한이 데이터 반출 권한까지 자동으로 포함해서는 안 되며, 에이전트는 추가 접근을 요청할 수 있지만 스스로 승인할 수는 없다.
3. 에이전트의 판단과 독립된 실행 환경 통제
보안 경계는 에이전트가 잘못 판단해도 유지돼야 하므로, 실행 환경이 파일·네트워크 목적지·프로세스에 대한 제한을 추론과 독립적으로 집행해야 한다. 지시와 안전장치는 행동을 유도할 수 있지만, 실제 보안에는 강제 가능한 경계가 필요하다. 각 에이전트에는 추적 가능한 신원과 담당 작업으로 제한된 자격 증명이 필요하며, 정보 접근·시스템 변경·승인 대상 행동을 정책으로 정의하고 중대한 작업과 권한 변경에는 사람의 승인을 요구해야 한다. 도구·스킬·의존성의 출처와 무결성도 검증하고, 보호된 실행 기록과 명확한 접근 철회·사고 억제 절차를 통해 조사 결과를 대응으로 연결해야 한다. NVIDIA OpenShell은 에이전트가 통제할 수 없는 위치에서 정책을 집행하고 샌드박스 실행과 데이터·네트워크·시스템 자원 접근 통제를 제공하는 오픈소스 보안 런타임이다. Open Secure AI Alliance 파트너인 Cisco의 DefenseClaw는 거버넌스 계층을 추가하며, JFrog는 OpenShell과 통합해 스킬을 검사·검증하고 접근 가능한 스킬에 관한 정책을 집행한다.
4. 배포 판단을 뒷받침하는 반복 검증
배포 전에는 에이전트의 범위를 벗어난 자격 증명 획득이나 민감 데이터의 무단 전송 시도가 적절한 통제로 차단된다는 증거를 확보해야 한다. 테스트는 권한 변경과 모니터링 방해 시도도 포함하고, 모델·도구·워크플로가 중대하게 바뀐 뒤에는 반복해야 한다. 명확히 지정된 책임자는 이 결과로 배포 준비 여부를 판단하고, 실패한 테스트가 시정 조치로 이어지도록 해야 한다. 테스트나 운영 중 발견된 실패는 재현·조사·해결하며, 각각의 발견을 반복 가능한 테스트로 바꿔 이후 릴리스에서도 수정 효과가 유지되는지 확인할 수 있다. 글은 반복 공격 시뮬레이션으로 방어를 시험하고 강화하는 CrowdStrike의 SafeMind와, 모델 및 애플리케이션 변화에 맞춰 지속적인 레드팀 활동을 수행하는 Palo Alto Networks의 Prisma AIRS를 사례로 든다.
5. 방어 목적에 맞는 모델과 도구 선택
실패 조사에는 과제와 데이터, 운영 환경에 맞는 역량을 갖춘 도구가 필요하며, 글은 개방형 모델과 폐쇄형 모델이 상호 보완적인 요구를 충족한다고 설명한다. 폐쇄형 모델은 관리형 기능과 서비스를 제공하고, 개방형 모델은 관련 구성요소를 검사하고 전략을 조정하며 직접 통제하는 인프라에서 작업할 선택지를 제공한다. 사고 대응 중에는 이러한 통제권을 통해 민감한 증거를 자체 환경에 유지하면서 실패를 재현하고 자사 시스템을 대상으로 수정 효과를 시험할 수 있다. 역량 있는 AI는 취약점 발견, 수정 검증, 공격 조사를 지원할 수 있지만 그 가치는 재현 가능한 발견과 검증 가능한 수정, 대응 시간 단축으로 평가해야 한다. 사례로는 AI 기반 코드 보안을 위한 Capital One의 VulnHunter와, 소프트웨어 패키지를 AI로 분석해 악성코드와 변조를 탐지하는 ReversingLabs의 Spectra Assure가 제시된다.
6. 공개 연구와 증거 공유로 방어 역량 확대
글의 마지막 논점은 개별 조직의 검증 결과를 더 넓은 보안 공동체의 방어 개선으로 연결하는 것이다. 무엇이 실패했고 어떤 통제가 작동했으며 수정 효과를 어떻게 확인했는지에 관한 증거를 공유하면, 다른 팀도 자체 시스템을 강화하는 데 활용할 수 있다. NVIDIA의 보안 연구와 Open Secure AI Alliance는 연구, 실용적인 도구, 전문성을 보안 공동체에 제공하면서 이러한 교류를 지원한다. 모든 에이전트 배포에는 강제 가능한 경계와 책임을 지는 담당자, 보호 기능이 작동한다는 증거가 필요하다는 원칙이 결론에서 다시 강조된다. 공개 연구와 공유 도구는 더 많은 방어자가 이 기준을 충족하도록 돕고, AI 능력이 발전하는 동안 보안 기준도 함께 개선하는 수단으로 제시된다.
🧾 핵심 주장 / 시사점
- 에이전트의 판단이 틀릴 가능성을 전제로 하면, 보안의 핵심은 행동 유도뿐 아니라 판단과 독립적으로 집행되는 권한·실행 경계에 있다.
- 명확한 책임자와 반복 가능한 테스트를 결합하면, 보호 효과의 증거를 배포 결정과 수정 조치에 연결할 수 있다.
- 개방형 모델의 통제 가능성과 검증 증거의 공유는 방어자가 자체 환경에서 문제를 재현하고 다른 팀의 경험을 활용하는 데 도움이 된다.
✅ 액션 아이템
- 모델·하네스·런타임별 보안 책임과 파일·네트워크·프로세스 접근 제한, 중대한 작업 및 권한 변경의 사람 승인 요건을 확인함.
- 범위 밖 자격 증명 획득·민감 데이터 무단 전송·권한 변경·모니터링 방해 시도의 차단 여부를 검증하고, 중대한 변경 후 반복 테스트 결과를 책임자의 배포 판단에 반영함.
- 개방형·폐쇄형 모델을 환경에 맞게 검토하고, 방어용 AI의 효과를 재현 가능한 발견·검증 가능한 수정·대응 시간 단축으로 평가함.
❓ 열린 질문
- 모델·하네스·런타임의 보안 경계가 에이전트의 잘못된 판단에도 유지된다는 것을 어떤 증거로 확인할 수 있는가?
- 모델·도구·워크플로의 중대한 변경 후 반복 테스트에서 실패가 발견되면, 지정된 책임자는 배포 여부와 시정 조치를 어떻게 판단할 것인가?
- 개방형·폐쇄형 모델의 상호 보완성을 활용할 때 재현 가능한 발견·검증 가능한 수정·대응 시간 단축을 어떻게 평가할 것인가?