Articleanthropic.com·2026년 8월 14일·0

How Claude's text watermarking works

Quick Summary

Anthropic은 EU AI Act 준수를 위해 향후 Claude 텍스트에 SynthID Text 기반의 비가시적·비식별 워터마크를 적용하되, 품질과 비용은 유지하고 Claude의 관여 가능성만 확률적으로 판별하도록 설계했다.

How Claude's text watermarking works 관련 대표 이미지

🖼️ 인포그래픽

How Claude's text watermarking works 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

How Claude's text watermarking works의 핵심 내용을 4단계로 요약한 인포그래픽
How Claude's text watermarking works 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Anthropic은 EU AI Act 준수를 위해 향후 Claude 텍스트에 SynthID-Text 기반의 비가시적·비식별 워터마크를 적용하되, 품질과 비용은 유지하고 Claude의 관여 가능성만 확률적으로 판별하도록 설계했다.

📌 핵심 요약

  • 향후 Claude 모델은 AI 생성 콘텐츠 표시를 요구하는 EU AI Act에 대응해 워터마크가 포함된 텍스트를 생성하며, Anthropic은 지역별 적용을 안정적으로 제한할 방법이 없어 출시 시점부터 이를 전 세계에 적용할 예정이다.
  • Claude의 워터마크는 의미상 큰 차이가 없는 후보 단어 중 하나를 고를 때 임의 난수 대신 비밀 키와 앞선 몇 단어를 이용하는 SynthID-Text 방식으로 패턴을 남기며, 텍스트에 문자나 식별 정보를 추가하지 않는다.
  • Anthropic의 내부 시험과 Google DeepMind의 Gemini 트래픽 및 인간 평가 연구에서는 워터마킹이 내용·창의성·가독성·품질에 유의미한 영향을 주지 않았고, 추가 토큰이나 비용도 발생하지 않으며 속도 영향도 미미했다.
  • 워터마크는 Claude가 텍스트 작성에 일부 관여했을 가능성만 보여 주며, 인간 작성 여부나 다른 AI의 사용 여부를 판별하지 못한다. 짧은 글·사실 문장·교정문·코드처럼 선택 가능한 표현이 적은 경우에는 탐지력이 낮아진다.
  • Anthropic은 Claude 워터마크 탐지 API를 준비 중이며, 2026년 8월 2일 이전에 출시된 모델에도 향후 수개월 동안 워터마킹을 추가할 계획이다. 지원되는 이미지와 파일에는 텍스트 워터마크 대신 C2PA 기반 콘텐츠 자격 증명이 메타데이터로 부착된다.

🧩 주요 포인트

  1. 단어 선택의 결과가 아니라 무작위성의 출처만 비밀 키 기반으로 바꾸는 구조 → 독자가 경험하는 의미와 품질을 유지하면서도 키를 이용한 사후 확률 판별이 가능하다.
  2. 워터마크가 작동할 공간은 Claude가 자유롭게 선택한 표현의 수와 표본 길이에 좌우됨 → 사실 문장·교정문·코드·짧은 글에서는 약하고, Claude가 더 많은 문장을 작성할수록 관여 탐지의 신뢰도가 높아진다.
  3. EU AI Act에 따른 전 세계 적용과 향후 탐지 API, 파일용 C2PA 자격 증명이 함께 추진됨 → 출처 투명성을 높이되 Claude 관여 여부와 개인·조직의 신원을 명확히 분리하는 방식이다.

🧠 상세 정리

1. 도입 배경과 전 세계 적용

Anthropic은 2026년 8월 14일, 향후 Claude 모델이 생성하는 텍스트에 워터마크를 적용한다고 발표했다. 직접적인 계기는 EU 시장에 서비스를 제공하는 AI 사업자에게 생성 콘텐츠 표시를 요구하는 EU AI Act이며, Anthropic은 2026년 7월 다른 주요 AI 제공업체들을 포함한 약 190개 서명 주체와 함께 관련 행동규범에 참여했다. 다른 주요 모델 개발사들도 같은 행동규범에 서명했으며 각자의 워터마크를 구현할 예정이다. Anthropic은 현재 워터마킹을 지역별로 지속 가능하게 제한할 방법이 없기 때문에 출시 단계에서는 전 세계에 적용하고, 다른 접근법도 계속 평가하겠다고 밝혔다. 2026년 8월 2일 이전에 출시된 Claude 모델에는 전환 기간이 적용되며, Anthropic은 향후 수개월에 걸쳐 이들 모델에도 기능을 추가할 계획이다.

2. 키 기반 단어 선택의 작동 원리

Claude와 같은 대규모 언어 모델은 앞에서 생성된 텍스트를 바탕으로 다음에 올 단어나 토큰의 후보를 평가하고 하나씩 선택한다. 정답이 사실상 하나뿐인 경우도 있지만, ‘흐리다’와 ‘회색빛이다’처럼 의미와 자연스러움이 비슷해 독자에게 큰 차이를 만들지 않는 후보도 자주 존재하며, 일반적인 생성에서는 이런 선택이 난수에 의해 결정된다. 워터마킹은 이러한 낮은 위험의 선택에서 임의 난수 생성기 대신 비밀 키와 앞선 몇 단어를 이용해 다음 단어를 결정한다. 결과 단어는 여전히 허용 가능한 후보 안에서 무작위로 선택되지만, 키를 가진 측은 나중에 단어 배열이 그 키에 따른 선택과 얼마나 일치하는지 검사해 Claude가 관여했을 확률을 산정할 수 있다. 이 방식은 숨은 문자나 별도 정보를 텍스트에 넣지 않으며, Claude가 평소 고려하지 않을 생소하거나 부자연스러운 단어를 억지로 선택하게 하지도 않는다.

3. 무작위성의 출처를 바꾸는 비유

Anthropic은 워터마크의 원리를 모노폴리 게임과 원주율의 숫자 배열에 비유한다. 보통은 매 차례 주사위를 굴려 이동 칸 수를 정하지만, 임의로 고른 원주율 소수점 이하 위치에서 시작해 이어지는 숫자를 차례로 주사위 값처럼 사용할 수도 있다. 게임 참가자와 결과의 관점에서는 두 방식 모두 사실상 무작위로 보이므로 진행 경험에 실질적인 차이가 생기지 않는다. 그러나 전체 이동 순서와 원주율을 함께 알고 있다면 사후에 그 게임이 원주율 배열을 이용했을 가능성을 계산할 수 있으며, 이 점에서 게임에는 탐지 가능한 패턴이 남는다. Claude 텍스트도 같은 원리로 독자에게 전달되는 의미와 읽기 경험을 바꾸지 않으면서, 키를 통해 생성 과정의 통계적 일관성을 확인할 수 있게 된다.

4. 품질·창의성·가독성 검증

Anthropic은 내부 시험에서 워터마킹이 Claude 텍스트의 내용, 창의성 수준, 가독성에 영향을 준다는 증거를 발견하지 못했다고 밝혔다. Claude가 사용하는 기법을 소개한 SynthID-Text 논문에서는 Google DeepMind가 워터마킹 모델을 Gemini 트래픽 일부에 제공한 뒤 이용자의 긍정 및 부정 평가를 비워터마킹 모델과 비교했다. 그 결과 두 모델 사이에서 통계적으로 유의미한 평가 차이가 나타나지 않았다. 별도의 통제 연구에서도 인간 평가자들이 워터마킹 답변과 비워터마킹 답변을 나란히 비교했지만 품질 차이를 확인하지 못했다. 워터마크는 추가 토큰을 생성하지 않으므로 제공 및 사용 가격이 동일하고, 모델 속도에 미치는 영향도 미미하며, 일반 독자는 두 종류의 응답을 구별할 수 없다.

5. SynthID-Text의 계보와 판별 한계

Claude의 텍스트 워터마크는 Google DeepMind가 2024년 Nature 논문으로 공개한 SynthID-Text 접근법의 한 버전이며, 그 설계 원리는 Scott Aaronson이 2022년에 제안한 방식까지 거슬러 올라간다. 이 계열의 핵심은 가능한 단어 후보를 바꾸는 것이 아니라 후보를 고르는 무작위성의 출처를 바꾸는 데 있다. 다만 Anthropic의 키로 답할 수 있는 질문은 해당 글이 Claude에 의해 일부 작성되었을 가능성이 어느 정도인지에 한정된다. 워터마크는 글이 인간에 의해 작성됐는지 확인할 수 없고, 서로 다른 AI는 다른 키나 전혀 다른 방법을 사용할 수 있으므로 다른 AI가 작성했는지도 판별하지 못한다. 또한 탐지는 ‘Claude가 직접 작성했다’와 ‘Claude가 대폭 편집했다’를 구분하지 못하며, 단지 콘텐츠 생성 과정의 어느 시점에 Claude가 관여했을 가능성만 나타낸다.

6. 길이·사실 문장·교정·번역에 따른 차이

워터마크 탐지는 선택 사례가 적은 짧은 표본에서는 충분한 정보를 확보하기 어려우며, 글이 길어지고 Claude가 더 많은 단어를 고를수록 관여 여부에 대한 신뢰도가 높아진다. 사실 문장에서는 정확성을 해치지 않고 바꿀 수 있는 단어가 적기 때문에 워터마크가 상대적으로 희박하다. 예를 들어 아이작 뉴턴의 대표 저작인 ‘Principia Mathematica’처럼 다음 단어가 사실상 하나로 정해진 문장에서는 워터마크가 개입할 선택지가 없다. 사람이 작성한 글의 문법과 문장부호만 교정하면 대부분의 단어가 그대로 유지되므로, Claude가 수정한 소수의 표현만으로는 관여가 탐지되지 않을 수 있다. 반대로 Claude가 생성한 번역문은 모든 단어를 Claude가 선택하므로 워터마크가 적용되며, 일반적으로 Claude가 더 많이 작성하거나 편집할수록 패턴이 남을 공간도 커진다.

7. 정확한 답과 코드에서의 제한적 적용

워터마킹은 서로 비슷하게 적절한 후보가 있을 때만 단어 선택에 관여하며, 정확한 출력이 요구되는 위치에는 적용되지 않는다. 예를 들어 ‘2 + 2 =’ 다음에 계산 결과를 완성한다면 ‘4’를 대신할 동등한 정답이 없으므로 워터마크의 선택 조정이 일어나지 않는다. 코드는 다른 용어나 기호를 선택하면 실행이 실패하거나 의미가 달라질 수 있는 경우가 많아 일반 자연어보다 워터마킹되는 부분이 적다. 다만 변수 표현이나 코드 주석처럼 여러 단어나 용어 가운데 임의로 선택할 수 있는 영역에서는 워터마크가 작동할 수 있다. 이러한 적용 원칙 때문에 워터마킹이 실제 코드의 정확성이나 동작에 미치는 영향은 미미하다고 Anthropic은 설명한다.

8. 비용과 개인·조직 정보 보호

워터마킹은 Claude가 원래 생성할 텍스트 안에서 단어 선택 방식만 바꾸므로 별도의 문자, 숨은 기호 또는 추가 토큰을 삽입하지 않는다. 이에 따라 모델 응답 가격은 기존과 동일하고 처리 속도에 미치는 영향도 미미하며, 사용자가 워터마크 때문에 별도의 비용을 부담하지 않는다. 워터마크와 그 키에는 이용자, 소속 조직 또는 Claude와 나눈 대화를 복원하거나 알아낼 수 있는 정보가 포함되지 않는다. 패턴이 가리키는 대상은 Claude와 해당 출력의 관계뿐이며, 특정 개인·조직·대화로 추적하는 식별 장치가 아니다. 다른 주요 AI 제공업체가 별도의 키나 방법을 사용할 수 있다는 점에서도 이 워터마크는 Claude의 관여 가능성을 확인하는 수단이지 이용자 신원을 나타내는 표식이 아니다.

9. 탐지 API·C2PA·편집에 의한 제거

Anthropic은 텍스트가 Claude에 의해 작성됐을 가능성을 검사할 수 있는 워터마크 탐지 API를 곧 제공할 예정이지만, 구체적인 구현 세부사항은 아직 조정 중이다. Claude가 지원되는 .png, .jpg, .svg 파일을 만들거나 처리할 때는 텍스트 워터마크와 다른 방식인 C2PA 콘텐츠 자격 증명이 암호학적으로 서명된 작은 메타데이터 기록으로 부착된다. C2PA는 카메라 제조사와 사진 편집 소프트웨어에서도 출처 기록에 사용하는 공개 업계 표준이며, 호환 도구로 읽을 수 있고 Anthropic도 자체 확인 도구를 제공할 예정이다. 이 기록은 파일의 시각적 내용에 숨겨 넣는 워터마크가 아니라 Claude가 제작 또는 처리에 관여했다는 사실을 표시하며, 개인 식별 정보는 담지 않는다. 텍스트를 가볍게 편집하면 워터마크가 완전히 사라지지 않을 가능성이 크지만 모든 단어를 교체하는 전면 재작성은 이를 제거할 수 있고, 남은 패턴도 Claude의 작성과 대폭 편집을 구별하지 못한다. Pangram과 같은 AI 탐지 소프트웨어는 Anthropic의 키를 갖고 있지 않기 때문에 Claude의 키 기반 워터마크 탐지와 다른 방법을 사용한다.

🧾 핵심 주장 / 시사점

  • Claude 워터마크는 저자 신원을 확정하는 증명이 아니라 생성 과정에서 Claude가 관여했을 가능성을 보여 주는 확률적 출처 신호다.
  • 정확성을 우선해 선택 가능한 표현에만 SynthID-Text를 적용하므로 품질 저하를 피할 수 있지만, 문서의 길이와 유형에 따라 탐지 가능성이 균일하지 않다는 제약이 따른다.
  • 텍스트에는 키 기반 통계 패턴을, 지원 파일에는 C2PA 메타데이터를 사용하는 서로 다른 방식이 적용되지만, 둘 다 Claude의 관여만 표시하고 개인이나 조직을 식별하지 않는다는 원칙을 공유한다.

✅ 액션 아이템

  • Claude 워터마크 판별 결과를 ‘Claude가 관여했을 가능성’으로 한정하고, 인간 작성 여부나 다른 AI의 사용 여부를 단정하지 않는 해석 기준 적용.
  • SynthID-Text 판별 시 짧은 글·사실 문장·교정문·코드의 낮은 탐지 가능성을 감안하고, Claude가 선택한 표현과 충분한 표본 길이의 존재 여부를 우선 확인.
  • EU AI Act에 따른 전 세계 적용, 2026년 8월 2일 이전 Claude 모델의 향후 수개월 도입 경과, 예고된 탐지 API의 공개 내용에 대한 후속 확인.

❓ 열린 질문

  • Claude 워터마크 탐지 API의 구체적인 출시 시점과 구현 방식은 언제 공개될까?
  • SynthID-Text는 짧은 글·사실 문장·교정문·코드에서 어느 정도의 탐지 신뢰도를 제공할 수 있을까?
  • 2026년 8월 2일 이전에 출시된 Claude 모델에는 향후 수개월 동안 어떤 순서와 범위로 워터마킹이 적용될까?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.