ArticleRussell Brandom·2026년 9월 10일·0

Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek

Quick Summary

Anthropic은 Alibaba·Moonshot AI 등 중국 AI 기업에 귀속한 5개 증류 공격 캠페인에서 약 2억 건의 교환을 관측했으며, Claude의 추론 과정과 핵심 역량을 추출하려는 시도가 더 정교하고 공격적으로 변했다고 주장했다.

Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek 관련 대표 이미지

🖼️ 인포그래픽

Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek의 핵심 내용을 4단계로 요약한 인포그래픽
Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic은 Alibaba·Moonshot AI 등 중국 AI 기업에 귀속한 5개 증류 공격 캠페인에서 약 2억 건의 교환을 관측했으며, Claude의 추론 과정과 핵심 역량을 추출하려는 시도가 더 정교하고 공격적으로 변했다고 주장했다.

📌 핵심 요약

  • Anthropic은 2026년 9월 10일 공개한 보고서에서 최근 수개월간 방어 장치를 우회하는 증류 공격이 확대됐으며, 5개 캠페인과 연결된 약 2억 건의 교환을 관측했다고 밝혔다.
  • 공격 대상은 Claude의 에이전트 기능, 도구 사용, 코딩, 데이터 분석, 논리적 추론이었다. Anthropic은 내부 사고 과정 대신 요약된 사고를 제공하지만, 공격자들이 번역 요청 등의 방식으로 실제 추론 흔적을 드러내도록 유도했다고 설명했다.
  • Anthropic은 Alibaba에 귀속한 캠페인에서 2026년 5~7월 3,500개 계정을 통한 1억 5,100만 건의 교환을 관측했다고 밝혔다. 하루 최대 규모는 약 300만 건이었으며, 공통된 고정 프롬프트를 근거로 Qwen 모델군의 학습 자료를 만들기 위한 단일 활동으로 판단했다.
  • Anthropic은 Kimi 개발사 Moonshot AI에 귀속한 캠페인이 중국 군의 요청을 직접 전달한 것으로 보인다고 주장했다. 10일 동안 5,000개 계정망을 통해 약 30만 건의 요청이 주로 Opus에 전달됐으며, 감시 영상 속 인물의 이상 행동 여부를 평가해 달라는 사례가 포함됐다.
  • Anthropic은 앞서 2월에도 증류 공격과 특정 연구소를 공개적으로 지목했고, OpenAI도 DeepSeek에 귀속한 유사 활동을 보고했다. 이번 기사 본문에는 DeepSeek의 새 캠페인에 대한 구체적인 규모나 수법은 제시되지 않았다.

🧩 주요 포인트

  1. 추론 흔적 추출 → 작은 모델의 일반 추론 능력을 지도 미세조정으로 학습시키는 자료가 될 수 있어, Claude의 사고 과정 공개 범위와 우회 가능성이 핵심 쟁점이다.
  2. Alibaba 관련 3,500개 계정의 공통 프롬프트 → Anthropic이 분산된 사용을 Qwen 학습 자료 확보를 위한 단일 캠페인으로 묶은 핵심 근거다.
  3. Moonshot AI의 중국 군 요청 전달 의혹 → 활용 목적과 요청 출처가 쟁점으로 확대되지만, 군 연계는 Anthropic이 제시한 추정으로 구분해야 한다.

🧠 상세 정리

1. 증류 공격의 확대와 이전 경고

2026년 9월 10일 TechCrunch가 소개한 Anthropic 보고서는 중국 AI 기업들의 지속적인 증류 공격이 최근 수개월간 확대됐다고 주장한다. Anthropic은 경쟁이 치열해지는 가운데 허가받지 않은 연구소들이 방어 장치를 우회하고 미국 최첨단 모델의 역량을 추출하는 수법을 고도화했다고 설명했다. 회사가 5개 캠페인에 연결해 관측한 교환은 총 약 2억 건으로, 이전에 공개한 사례보다 규모가 크고 공격적이라는 평가다. Anthropic은 이미 2월에도 특정 연구소를 지목하며 문제를 제기했고, OpenAI 역시 DeepSeek에 귀속한 유사 활동을 보고한 바 있다.

2. 추론 흔적을 학습 자료로 바꾸는 방식

기사에 따르면 증류 공격은 다양한 질의에 대한 모델 응답에서 사고 과정을 추출하는 데 초점을 맞춘다. 확보한 사고 과정은 지도 미세조정을 통해 더 작은 모델에 일반적인 추론 능력을 학습시키는 데 쓰일 수 있다. Anthropic은 통상 내부 사고 과정을 직접 공개하지 않고 개요를 담은 ‘요약된 사고’ 블록을 제공하지만, 보고서 속 캠페인들은 실제 추론 흔적을 드러내게 하는 우회 기법을 찾았다고 한다. 한 사례에서는 이전 작업 기억을 가타카나만 사용하는 일본어로 번역해 달라는 요청으로 모델을 유도했다. 보고서가 지목한 표적 역량은 Claude의 에이전트 기능과 도구 사용, 코딩과 데이터 분석, 논리적 추론이다.

3. Alibaba에 귀속된 최대 규모 캠페인

Anthropic은 증류 시도의 대부분을 Alibaba에 귀속한 캠페인에서 관측했으며, 이를 자사가 본 가장 큰 전면적 증류 활동으로 묘사했다. 해당 캠페인과 연결된 교환은 2026년 5월부터 7월까지 1억 5,100만 건이었고, 하루 최대 약 300만 건에 달했다. 활동은 3,500개 계정에 분산돼 있었지만, 사고 과정을 추출하는 데 동일한 고정 프롬프트가 사용됐다는 점이 공통 근거로 제시됐다. Anthropic은 이를 Alibaba의 Qwen 모델군에 사용할 학습 자료를 생산하려는 단일 활동으로 판단했다. 이러한 계정 연결과 목적의 귀속은 기사에서 Anthropic의 분석으로 전달된다.

4. Moonshot AI 캠페인과 군 연계 의혹

또 다른 캠페인은 Kimi 개발사인 Moonshot AI에 귀속됐으며, Anthropic은 이 활동이 중국 군의 요청을 직접 전달한 것으로 보인다고 주장했다. 보고서가 든 사례 중 하나는 폐쇄회로 감시 영상 묶음을 분석해 대상 인물이 비정상적으로 행동하는지 판단해 달라는 요청이었다. Anthropic에 따르면 어느 10일 동안 5,000개 계정으로 구성된 망을 통해 약 30만 건의 요청이 Claude로 전달됐고, 주된 표적은 Opus였다. 이 사례는 요청량뿐 아니라 사용 목적과 요청 출처도 보고서의 논점임을 보여준다. 다만 군 연계는 확정된 사실이 아니라 Anthropic이 제시한 추정으로 읽어야 한다.

5. 기사에서 확인할 수 있는 범위

기사 제목에는 Alibaba, Moonshot AI, DeepSeek가 함께 등장하지만, 본문에서 새 캠페인의 규모와 수법을 구체적으로 설명한 대상은 Alibaba와 Moonshot AI다. DeepSeek는 OpenAI가 앞서 보고한 유사 활동의 귀속 대상으로 언급되며, 이번 새 보고서와 관련한 개별 수치는 본문에 제시되지 않는다. 전체 5개 캠페인 가운데 나머지 활동의 세부 내역이나 지목된 기업들의 반론도 기사에는 담겨 있지 않다. 따라서 약 2억 건이라는 전체 관측 규모와 개별 캠페인 수치는 구분해야 하며, 기업별 귀속과 목적에 관한 설명 역시 Anthropic의 주장이라는 성격을 유지해야 한다.

🧾 핵심 주장 / 시사점

  • Anthropic의 설명대로라면 요약된 사고만 제공하는 정책에도 추론 흔적을 직접 드러내는 우회 가능성이 남아 있으며, 공개 범위와 실제 방어 효과를 구분할 필요가 있다.
  • Alibaba 사례에서 공통 프롬프트는 대규모 분산 계정을 하나의 활동으로 연결하는 근거로 사용됐다. 다만 기사만으로 기업 귀속과 학습 목적을 독립적으로 확인할 수는 없다.
  • Moonshot AI 사례는 증류 공격의 규모에 더해 요청 출처와 활용 목적을 쟁점으로 제시하지만, 중국 군 연계의 불확실성을 유지하는 것이 중요하다.

✅ 액션 아이템

  • Claude의 요약된 사고 제공 방식과 번역 요청을 통한 추론 흔적 노출 가능성을 함께 검토.
  • Alibaba 관련 1억 5,100만 건의 교환과 공통 프롬프트를 구분해 Qwen 학습 목적이라는 귀속 판단의 근거를 검토.
  • Moonshot AI의 중국 군 요청 전달을 추정으로 명시하고, DeepSeek의 새 캠페인 세부 정보가 본문에 없다는 한계를 유지.

❓ 열린 질문

  • Claude의 요약된 사고 제공에도 번역 요청으로 추론 흔적이 노출된 우회는 어떤 조건에서 가능했는가?
  • Alibaba 관련 3,500개 계정의 공통 프롬프트 외에 Qwen 학습 목적이라는 판단을 뒷받침하는 근거는 무엇인가?
  • Moonshot AI가 중국 군의 요청을 직접 전달한 것으로 보인다는 Anthropic의 추정은 어떤 근거에 기반하는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.