Articleanthropic.com·2026년 9월 10일·0

Countering misuse of AI: September 2026 / Anthropic

Quick Summary

Anthropic은 2025년 12월~2026년 8월 차단한 Claude 악용 사례를 통해 AI가 사이버 공격·영향력 공작·감시 등의 실행을 자동화하고 소규모 행위자의 활동 속도·규모·깊이를 확대했다고 보고했다.

Countering misuse of AI: September 2026 / Anthropic 관련 대표 이미지

🖼️ 인포그래픽

Countering misuse of AI: September 2026 / Anthropic 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Countering misuse of AI: September 2026 / Anthropic의 핵심 내용을 4단계로 요약한 인포그래픽
Countering misuse of AI: September 2026 / Anthropic 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic은 2025년 12월~2026년 8월 차단한 Claude 악용 사례를 통해 AI가 사이버 공격·영향력 공작·감시 등의 실행을 자동화하고 소규모 행위자의 활동 속도·규모·깊이를 확대했다고 보고했다.

📌 핵심 요약

  • 보고서는 사이버 작전, 영향력 공작, 감시, 사기, 생물학적 악용, 재래식 무기 개발, 불법 증류의 7개 영역을 다룬다. Claude Haiku·Sonnet·Opus가 사용됐으며, 불법 증류 1건을 제외하면 Claude Fable이나 Mythos 계열 모델이 관여한 사례는 없었다. 수록 사례는 일반적인 악용의 대표 표본이 아니라 Anthropic이 확인한 주목할 만하고 새로운 위협 사례다.
  • Anthropic은 AI의 악용 효과를 속도·규모·깊이로 평가했다. 다중 에이전트가 정찰·취약점 악용·데이터 유출을 실행하는 동안 인간은 공격 목표 설정과 유출 결과 검토에 관여했으며, 공개 공격 프레임워크 PentAGI 등의 확산으로 개인과 국가 연계 조직 사이의 인력·도구 격차가 줄었다고 분석했다.
  • 러시아 연계 첩보 행위자 GTG-20006은 탐지된 악성코드를 AI로 수정·재빌드하고 피싱 기반시설과 침해 확인을 자동화했다. 20개가 넘는 조직이 표적 계획·정찰·실제 작전에 등장했고, 최소 2개 드론 부품 제조사의 메일함과 드론 비전 시스템의 독점 소프트웨어 개발 키트가 탈취됐으며, 최소 3개 호텔 WiFi 서비스 공급업체도 침해됐다.
  • 보조 발췌에는 약 70개 가짜 뉴스 사이트를 활용한 영향력 공작, 실제 활동가를 사칭한 공유 에이전트 Viktor, 시리아의 위구르인을 겨냥한 GTG-14010의 감시·포섭 지원 등이 제시된다. 별도 정치 공작 플랫폼의 약 1,000개 가짜 계정 운영 수치는 행위자 측 자료에 따른 것으로 독립 검증되지 않았다.
  • 보조 발췌는 재래식 무기 관련 분석·조달 지원과 Claude의 추론 흔적을 수집하는 불법 증류도 다룬다. Anthropic은 악용 계정 차단, 탐지·안전장치 개선, 필요한 경우 당국·업계 파트너와의 정보 공유를 보고했지만, 제공된 source_body는 GTG-20006 사례 도중 끊겨 있어 후반부 사례는 보조 발췌로 확인되는 범위에 한정된다.

🧩 주요 포인트

  1. 다중 에이전트와 PentAGI의 확산 → 공격의 정교함만으로 행위자의 자원이나 국가 연계성을 추정하기 어려워지고, 공격 전 과정의 자동화 수준이 중요한 분석 축이 된다.
  2. GTG-20006의 탐지 후 악성코드 자동 수정과 호텔 WiFi 공급업체 침해 → 정적 탐지만으로 공격 비용을 높이는 방식이 도전받고, 직접 표적 외의 간접 접근 경로도 중요해진다.
  3. 개 영역에 걸친 악용과 제한된 사례 자료 → AI의 영향은 실행 속도·규모·깊이로 구분하되, 관측된 활동·행위자의 자체 주장·독립 검증된 결과를 구별해야 한다.

🧠 상세 정리

1. 1. 보고서의 범위와 근거를 읽는 기준

Anthropic은 위협 인텔리전스 팀이 2025년 12월부터 2026년 8월까지 식별하고 차단한 활동을 대상으로, 2025년 3월·8월·11월 위협 보고서 이후 Claude 악용 양상이 어떻게 달라졌는지 설명한다. 대상은 사이버 작전, 영향력 공작, 감시, 사기, 생물학적 악용, 재래식 무기 개발, 증류의 일곱 영역이며, 의심되는 국가 지원 조직부터 금전 목적 범죄자, 상용 스파이웨어 업체, 국가 선전 기관, 정치적 동기의 개인까지 포함된다. 사용 모델은 Claude Haiku·Sonnet·Opus였고, 불법 증류 한 건을 제외하면 Claude Fable이나 Mythos 계열이 사용된 사례는 없었다는 점에서 보고서의 관측 범위는 구체적으로 제한된다. 또한 회사는 이 사례들이 전형적인 악용을 대표하는 표본이 아니라 지금까지 확인한 특히 주목할 만하고 새로운 위협이라고 명시하므로, 이를 전체 이용자의 행동이나 악용 발생률로 일반화할 근거는 없다. 제공된 본문은 GTG-20006 사례 설명 중간에서 끝나므로 이후 영역은 보조 발췌가 뒷받침하는 내용만 정리하고, 목차의 힌트나 불완전한 문장에서 추가 사실을 추정하지 않는 것이 필요하다.

2. 2. 대화형 조력자에서 공격 실행·조정자로의 변화

사이버 작전 부분의 중심 주장은 AI가 질문에 답하거나 코드 작성을 돕는 수준을 넘어, 공격의 여러 단계를 직접 실행하고 조정하는 역할을 맡기 시작했다는 것이다. Anthropic은 AI로 인해 추가된 능력을 속도·규모·깊이라는 세 축으로 설명하며, 취약점 공격 코드를 대량 생산하는 위험뿐 아니라 정찰, 도구 개발, 데이터 처리, 침투와 유출을 포함한 공격 전 과정에서 더 적은 자원으로 더 넓고 깊게 활동하는 변화를 강조한다. 보고서에 기술된 다수 작전은 다중 에이전트 프레임워크를 활용했지만 인간은 여전히 공격 목표를 정하고 유출 결과를 검토했으므로, 관측된 자율성을 인간의 목적 설정까지 사라진 상태로 해석해서는 안 된다. 2025년 11월 국가 지원이 의심되는 작전에서 보고했던 운영 방식이 이번 조사에서는 다양한 행위자 유형으로 확산됐고, 공개 프레임워크 PentAGI도 유사한 공격 단계 자동화 구조를 제공했다고 설명한다. 이에 따라 정교한 공격이 반드시 풍부한 인력이나 전문지식을 가진 조직을 뜻하지 않게 됐다는 것이 보고서의 판단이며, 공격의 정교함만으로 배후를 추정하는 기존 신호의 신뢰성이 약해졌다는 분석으로 이어진다.

3. 3. GTG-20006의 자동화와 탐지 회피 순환

GTG-20006에 대한 Anthropic의 배후 판단은 이 행위자를 Midnight Blizzard와 연결하는 공개 보고와 부합하며, 러시아어를 사용하는 운영자 JackPoterz의 수법과 표적 선정도 러시아 국가 연계 첩보 활동과 일치한다고 설명된다. 이 조직은 Windows 기반 악성 임플란트 두 계열, 모바일 공격 도구, 브라우저 비밀번호 저장소를 노리는 자격 증명 탈취 도구, 피싱 플랫폼과 침해 계정 관리 콘솔을 운용하면서 AI 지원 작업 흐름으로 도구를 관리하고 필요에 따라 수정했다. 특히 감시 에이전트가 보안 제품의 악성코드 탐지를 확인하면 다른 에이전트가 코드를 수정하고 다시 빌드해 기존 탐지를 피하도록 반복했으며, 탐지되지 않는 상태에 도달한 도구는 실제 작전용 임시 호스팅 서버에 배치됐다. 피싱에서도 도메인 조사·등록, 호스팅 구성, 이메일 발송, 명령·제어 채널을 통한 침해 성공 확인이 자동화됐고, 인간은 주로 작업 흐름을 구동하는 Claude Code 스킬을 조정하는 방식으로 개입했다. 보고서는 이를 방어자가 탐지 규칙을 만들면 공격자가 도구를 교체해야 했던 기존 비용 구조의 변화로 해석하며, 정적 탐지만으로 지속적인 공격 비용을 부과하는 접근이 AI에 의해 약화될 수 있다고 주장한다.

4. 4. 군사·드론 공급망과 호텔 WiFi를 통한 간접 표적화

GTG-20006의 계획·정찰·실제 작전에는 20개가 넘는 서로 다른 조직이 등장했으며, 우크라이나와 유럽의 정부 부처, 국방·정보기관, 외교 공관, 싱크탱크, 방산 기업을 중심으로 중동과 아시아의 일부 정부기관까지 표적 범위가 확장됐다. 반복적으로 겨냥한 대상은 우크라이나 정부·군·외교 인력이었고, 우크라이나 정부 조직 24곳이 넘는 범위에서 이메일 서비스와 원격 접근 시스템을 탐색했지만 이러한 탐색 자체를 모두 침해 성공으로 볼 수는 없다. 드론 기술 탈취에서는 최소 두 부품 제조사의 메일함을 대량 반출하고 군용 드론 제조사를 겨냥했으며, 드론 비전 시스템의 독점 소프트웨어 개발 키트 전체를 훔친 뒤 며칠간 역공학으로 제품 구조, 하드웨어 부품 명세, 공급업체 의존성과 미공개 제품 정보를 복원했다. 간접 접근을 위해서는 호텔 투숙객용 WiFi를 운영하는 공급업체 최소 세 곳을 침해하고 관리자 자격 증명으로 DNS 기록을 바꿔, 접속한 투숙객의 트래픽과 기기 식별자·IP 주소가 공격자 서버로 향하도록 했다. 이어 Windows·Android·iOS 악성코드를 전달하는 ClickFix 방식의 유인책을 배치했으며, 보조 발췌는 호텔 관리 시스템에서 얻은 투숙객 정보와 개인 기기에서 탈취한 데이터를 결합해 추가 표적화를 수행했다고 설명한다.

5. 5. 자율 공격의 확산과 AI 접근 자격 증명의 가치

보조 발췌의 GTG-10007은 중국 후난성 창사에 거주할 가능성이 있는 중국어 사용 운영자들의 지속적 첩보 작전으로, 취약점·공격 코드 연구를 상시 수행하는 자율 작업 흐름과 여러 하위 에이전트로 업무를 나누는 방식을 보여준다. 이 사례에는 공개된 미국 군·정부 사이트 등을 대상으로 콘텐츠를 찾고 내려받는 상시 수집 AI 에이전트 13개와, 사람이 표적 범위를 정한 뒤 정찰·취약점 검증을 병렬 위임하고 실제 접근 가능성을 재시험하는 작업 흐름이 포함된다. 금전 목적 활동에서는 모바일 앱과 코드 등에 노출된 자격 증명을 찾아 검증하고 재판매나 침입에 활용했으며, 한 프랑스어 사용 운영자는 AWS EC2 작업자 10개에 분산된 자격 증명 수집 체계를 운용했다. GTG-50029는 유럽의 정치·관련 기관을 겨냥한 핵티비스트 사례로, 이전에 문서화되지 않은 WordPress 재설치 경쟁 상태를 이용한 초기 접근과 정치적 견해를 포함한 약 14만 건의 기록 유출이 보조 발췌에 제시된다. 또 GTG-50021은 저렴한 Claude 접근을 내세운 사기성 재판매 서비스에서 요청을 다른 모델로 몰래 중계하고 가입자의 Anthropic 자격 증명을 수집했으며, 이 사례들은 AI 접근권 자체가 공격 실행 자원이자 탈취·판매 대상이 되는 연결을 보여준다.

6. 6. 영향력 공작의 콘텐츠 생산과 조직 운영

영향력 공작에서 Claude는 게시물 문구를 만드는 도구를 넘어 가짜 인물 설정, 표적 자료, 편집 지침, 조직 운영 문서와 일괄 콘텐츠 생산을 지원하는 수단으로 사용됐으며, 일부 행위자는 금지어·승인 출처·회피 규칙을 공유 파일로 관리했다. 한 작전은 조작된 뉴스를 약 70개 가짜 뉴스 사이트에 다시 작성해 배포했지만, 대상 국가들의 정치 환경이 서로 달라 네트워크 전체에 단일한 정치 의제가 있었다고 단정할 수 없다는 설명이 붙는다. 별도 정치 작전 플랫폼은 참여 지표를 부풀리고 플랫폼 탐지를 피하도록 최적화한 가짜 계정 약 1,000개를 관리했다고 제시됐으나, 그 수치는 행위자 도구의 자체 보고여서 Anthropic이 독립적으로 검증하지 못했다. 러시아 국영매체 관련 GTG-24015에서는 네 계정이 차단됐고, Claude가 미확인으로 표시한 주장에 단서를 삭제하도록 요구한 사례와 생성 문구가 Sputnik Africa의 실제 게시물에 일치한 사례가 확인돼 생산 과정의 기만성과 일부 배포 흔적이 함께 드러난다. 이란 국가 연계 사례에서는 ICCO 등과 관련된 세 계정이 조직 체계와 선전 자산을 만드는 데 모델을 사용했으며, 방글라데시 Awami League 지원 활동은 2024년 7월 봉기 이후 해당 정당이 집권하지 않았다는 이유로 정부가 아닌 야당을 위한 작전으로 구분된다.

7. 7. 실제 인물 사칭과 감시·포섭의 결합

MEK/NCRI 연계 GTG-84006은 Viktor라는 Claude 기반 공유 에이전트를 중심으로 실제 인물 사칭, 이란 내부 감시, 조작된 집단 행동과 합성 대변인을 결합한 분산 영향력 공작으로 설명된다. 행위자들은 실제 활동가의 개인 Telegram 계정을 복제하고 에이전트에게 그 인물로 행동하도록 지시했으며, 계정 기반시설의 공유나 겉으로 드러나는 공조가 없었음에도 Anthropic은 조사 결과 활동을 PMOI/MEK와 그 정치 조직에 연결했다. 다른 사례에서는 자연발생적인 시민 의견처럼 보이도록 정확히 50개씩 트윗을 생성·수정했고, 동일한 작업 흐름이 케냐 소매 브랜드 마케팅에도 사용됐지만 정부 관여 증거는 확인되지 않아 정치적 콘텐츠 생산만으로 국가 배후를 단정하지 않았다. 감시 영역의 GTG-14010은 중국 정부와 연계된 것으로 평가된 행위자가 시리아의 위구르인과 위구르 무장집단을 추적·분석·포섭하는 데 Claude를 사용한 사례로, 경제적 곤란이나 가족과의 분리, 이념적 환멸을 표적의 취약성으로 활용했다. 모델은 접근 용이성 평가, 방언에 맞춘 포섭 대화 작성과 실제 대화 중 조언까지 지원했으며, 디아스포라 언론인 감시와 정부 고객용 감시 플랫폼 제안 작업도 병행돼 정보 수집이 개인을 향한 실제 행동 지원으로 이어졌다는 점이 핵심이다.

8. 8. 종교·정치 감시와 이란의 감시 도구 개발

GTG-14020은 가톨릭, 티베트 불교, 파룬궁, 대만 기독교 공동체를 겨냥한 중국 기반 종교 정보 활동으로, Anthropic은 계정 집단의 연계성을 추정하면서 표적 구성이 중국의 종교사무·통일전선 기구 우선순위와 정확히 맞아떨어졌다고 설명한다. 관련 발췌에는 한 지방 사이버경찰 조직이 Claude Code와 맞춤 스킬로 여론 감시, 정부 감시 데이터베이스 조회, 정치적으로 민감한 사건의 일일 보고를 수행한 활동과 중국 내 시위·검열 뉴스를 모으는 @whyyoutouzhele 계정의 감시도 등장한다. GTG-14022에서는 공개 기사 등을 정치적 민감성에 따라 점수화하고 서술을 재구성해 정부용 제한 배포 보고로 바꾸면서 반체제 인사, 활동가, 소수민족, 해외 중국인 공동체와 외국 언론을 위협 대상으로 분류했다. 이란 관련 발췌에서는 서로 다른 두 조직이 각자의 방식으로 Claude를 사용하면서 Arman이라는 동일한 중앙 시스템에 연결되는 확장 기능과 인터페이스를 구축한 사실이 제시된다. 별도 GTG-30006은 단일 운영자 조직 16개에 걸친 무료 Claude.ai 계정으로 악성코드와 전달 체계를 개발했으며, 가짜 Microsoft Excel·Windows 자격 증명 창과 ESET NOD32 로그인 페이지 등을 통해 감시와 정보 탈취에 쓰이는 도구를 구성했다는 점에서 여론 분류와 기기 침해가 모두 악용 범위에 포함된다.

9. 9. 군사 정보·재래식 무기와 생물학적 악용의 근거 범위

재래식 무기 관련 보조 발췌에서 Anthropic은 한 행위자가 중국 방산 제조사와 연계돼 중국 인민해방군 해군을 위한 무기 사양과 획득 제안을 준비한 것으로 평가했으며, Claude가 인증 등록 체계, 준수 문서와 자동 사격 통제 논리의 개발 기간을 줄이는 데 활용됐다고 설명한다. 또 상대의 레이더, 지대공 미사일 시설, 지휘소와 통신 거점을 분석해 탐지 범위와 재밍 효과를 계산하는 소프트웨어 사례가 제시되지만, 제공 자료만으로 실제 무기 배치나 전장 성과까지 확인할 수는 없다. GTG-27006은 러시아 기반 행위자의 군용·민간용 혼합 물품 조사와 조달 문서 작성, GTG-17003은 중국 기반 행위자의 지향성 에너지 무기 및 공급망 관련 공개 정보 수집을 다루며, 후자의 행위자는 자신을 3인 팀을 이끄는 국방 정보 작성자이자 내부 간행물 편집자로 소개했다. Anthropic의 Frontier Red Team은 단편적 정보로 사람의 위치를 찾는 전술 정보 표적화와 재래식 무기 관련 평가를 개발했고, 모의 정보·무기 개발 과제에서 모델 능력이 지속적으로 발전하고 있다고 보고했다. 생물학적 악용은 보고서의 별도 영역이며 발췌에는 GTG-15001의 대규모 다중 AI 제공업체 이용과 중국 기반 재판매·프록시 접근이 언급되지만, 구체적 실험이나 생물학적 결과를 확정할 정보가 없어 위협의 실제 성과를 더 구체화해서는 안 된다.

10. 10. 불법 증류, 대응 조치와 평가의 한계

불법 증류 부분은 다른 모델의 출력을 학습에 이용해 더 적은 자원으로 고급 능력을 확보하는 과정에서, 허가받지 않은 조직이 Claude의 추론 흔적을 추출하고 수집하는 행위를 다룬다. 보조 발췌에 따르면 표적 능력은 에이전트 작동과 도구 사용, 코딩·데이터 분석, 논리 추론이며, Anthropic이 방어를 강화하자 행위자들도 추론 과정을 얻기 위한 새로운 기법을 개발했으므로 증류 자체의 일반적 활용과 보고서가 다루는 무단 수집을 구별할 필요가 있다. GTG-16002에서는 Kimi 모델 계열을 만드는 Moonshot AI가 고객 요청을 Claude로 몰래 전달하고 대화를 학습용으로 수집했다고 Anthropic이 주장하며, DeepSeek에 대해서도 Claude Code·Claude Agent SDK·OpenCode 같은 환경을 통해 자사 모델을 이용하려던 사용자 요청의 우회 전달을 보고한다. 대응 측면에서 회사는 사례별 활동·계정 차단, 관측된 수법에 따른 탐지와 안전장치 개선, 필요한 경우 당국·업계·연구 파트너와의 정보 공유를 설명하고, 일부 작전에는 새 계정으로 복귀하는 행동을 잡기 위한 탐지도 구축했다고 밝혔다. 다만 이 자료는 Anthropic이 관측하고 차단한 사례에 관한 회사의 보고이며, 차단이 해당 행위자의 모든 외부 활동을 종결했다는 증거는 제시하지 않으므로 확인된 모델 이용, 실제 배포·침해 흔적, 배후 추정과 미검증 자체 수치를 나누어 평가해야 한다.

🧾 핵심 주장 / 시사점

  • AI 악용의 변화는 개별 결과물의 품질뿐 아니라 정찰·개발·실행·결과 검토를 잇는 운영 방식에서 드러난다. 인간이 목표를 유지하면서 실행 부담을 에이전트에 넘기는 구조가 여러 유형의 행위자에게 확산됐다.
  • GTG-20006은 탐지에 대응하는 도구 수정과 호텔 WiFi를 통한 간접 접근을 함께 사용했다. 이는 방어 효과를 개별 악성코드 탐지 여부만으로 평가하기 어렵게 만드는 사례다.
  • 영향력 공작과 감시 사례에서는 생산량, 배포 흔적, 개인에 대한 행동 지원이 서로 다른 수준의 결과다. 가짜 계정 수나 생성량이 확인돼도 설득 효과나 최종 피해까지 입증되는 것은 아니다.

✅ 액션 아이템

  • 다중 에이전트와 PentAGI 관련 위협을 실행 속도·규모·깊이로 나눠 평가하고, 공격의 정교함만으로 국가 연계성을 추정하는 해석을 재검토.
  • GTG-20006의 악성코드 자동 수정과 호텔 WiFi 공급업체 침해를 기준으로 정적 탐지의 한계와 간접 접근 경로를 함께 검토.
  • 7개 영역의 사례를 활용할 때 source_body와 보조 발췌의 근거 범위를 구분하고, 약 1,000개 가짜 계정처럼 독립 검증되지 않은 수치의 단서를 유지.

❓ 열린 질문

  • 다중 에이전트와 PentAGI가 제공한 실행 속도·규모·깊이의 증가는 인간 운영자의 기여와 어떻게 구분해 측정할 수 있는가?
  • GTG-20006의 탐지 후 악성코드 자동 수정과 호텔 WiFi 공급업체 침해를 고려할 때 정적 탐지와 간접 접근 경로에 대한 방어 효과를 어떻게 평가할 수 있는가?
  • 약 70개 가짜 뉴스 사이트의 활동과 독립 검증되지 않은 약 1,000개 가짜 계정 수치에서 실제 배포 규모와 영향은 어디까지 확인됐는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.