Anthropic shares more details about how Claude’s new watermarks will work
Quick Summary
Anthropic은 EU AI Act 투명성 코드 준수를 위해 Claude 생성 텍스트에 SynthID Text 워터마크를 적용하고 탐지 API를 공개할 계획이며, 편집 정도와 코드의 선택 자유도에 따라 워터마크의 탐지 가능성이 달라진다고 설명했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Anthropic은 EU AI Act 투명성 코드 준수를 위해 Claude 생성 텍스트에 SynthID-Text 워터마크를 적용하고 탐지 API를 공개할 계획이며, 편집 정도와 코드의 선택 자유도에 따라 워터마크의 탐지 가능성이 달라진다고 설명했다.
📌 핵심 요약
- Anthropic은 Claude 생성 콘텐츠를 식별할 수 있도록 워터마크를 도입하며, 그 배경으로 EU AI Act 투명성 코드 준수를 제시했다.
- Claude는 의미와 품질에 영향을 주지 않는 낮은 중요도의 단어 선택에 키로 탐지할 수 있는 패턴을 만들며, Anthropic은 독자가 워터마크 유무를 구별할 수 없다고 밝혔다.
- Anthropic은 Google DeepMind가 2024년에 설명한 SynthID-Text 방식을 사용하고 워터마크 탐지 API를 공개할 계획이며, 이를 문체상 특징을 추정하는 Pangram 등의 AI 탐지 방식과 구분했다.
- 가벼운 편집만으로는 워터마크가 완전히 사라지지 않을 가능성이 있지만 모든 단어를 바꾸는 완전한 재작성은 이를 제거하며, Claude가 교정한 글의 탐지 여부는 글의 길이와 편집 강도에 좌우된다.
- 작동해야 한다는 제약이 큰 코드는 일반 텍스트보다 워터마크가 적게 적용되고 주석 등 임의 선택이 가능한 부분에는 적용될 수 있으며, 다른 주요 모델 개발사들도 자체 워터마크를 구현할 예정이다.
🧩 주요 포인트
- 규제 준수에서 공동 도입으로의 확장: EU AI Act 투명성 코드에 서명한 주요 모델 개발사들이 자체 방식을 준비하면서 워터마크는 Claude만의 변화에 그치지 않는다.
- 키 기반 신호와 문체 추정의 분리: SynthID-Text는 의도적으로 삽입된 패턴을 확인하므로 Pangram처럼 표현상의 특징을 찾는 AI 탐지와 원리가 다르다.
- 선택 가능성과 탐지 강도의 연동: 일반 텍스트, 가벼운 편집, 완전한 재작성, 코드처럼 모델이 선택할 수 있는 범위가 달라지면 워터마크의 적용 및 탐지 가능성도 달라진다.
🧠 상세 정리
1. 도입 배경과 이용자 논쟁
Anthropic은 Claude가 생성한 텍스트에 워터마크를 적용하는 방식과 편집 및 코드에 미치는 영향을 설명하는 글을 공개했다. 회사가 제시한 직접적인 도입 배경은 AI 생성 콘텐츠를 식별할 수 있는 체계를 요구하는 EU AI Act 투명성 코드의 준수다. 발표 이후 Reddit에서는 무고한 Claude 이용자를 겨냥한 조치라는 주장과 AI 사용 사실을 숨기지 않는다면 반대할 이유가 없다는 주장이 맞섰다. Business Insider에 따르면 X에서도 수십 명의 이용자가 이 조치 때문에 Claude 구독을 취소한다고 주장해, 기술적 작동 방식이 공개되기 전부터 이용 목적과 투명성을 둘러싼 논쟁이 이어졌다.
2. 워터마크의 기본 작동 원리
Anthropic의 설명에 따르면 Claude는 날씨를 표현할 때 ‘흐린’과 ‘회색빛’처럼 의미상 큰 차이가 없는 단어 중 하나를 고르는 낮은 중요도의 선택을 활용한다. 이런 선택을 여러 차례 조정해 응답 안에 일정한 패턴을 만들고, 해당 패턴을 인코딩한 키를 가진 주체가 이를 탐지할 수 있도록 하는 방식이다. 패턴은 일반 독자에게 드러나는 표시가 아니며, Anthropic은 워터마크가 포함된 응답과 포함되지 않은 응답을 독자가 구별할 수 없다고 밝혔다. 회사는 이러한 선택이 Claude 출력의 품질에도 영향을 주지 않는다고 주장했으며, 워터마크를 눈에 보이는 라벨이 아니라 생성 과정에 삽입되는 탐지 가능한 신호로 설명했다.
3. SynthID-Text와 기존 AI 탐지의 차이
Anthropic은 Google DeepMind 팀이 2024년에 공개한 SynthID-Text 접근법을 Claude의 워터마크에 사용할 예정이라고 밝혔다. 또한 외부에서 워터마크 포함 여부를 확인할 수 있도록 탐지 API를 공개할 계획이라고 설명했지만, 기사에는 구체적인 공개 시점이나 이용 조건이 제시되지 않았다. 이 방식은 Pangram 같은 업체가 문장 표현에서 AI 사용의 흔적을 추정하는 방식과 구별된다. 예를 들어 특정한 대비 문장 구조처럼 글에 자주 나타나는 특징을 찾는 것은 문체상의 단서를 분석하는 일이지만, SynthID-Text의 워터마크 확인은 생성 시 의도적으로 삽입된 패턴을 키로 검사하는 일이라는 것이 Anthropic의 설명이다.
4. 편집과 재작성에 따른 탐지 변화
Anthropic은 생성된 글을 다시 쓰면 워터마크를 숨길 수 있지만, 가벼운 편집만으로는 워터마크가 완전히 제거되지 않을 가능성이 크다고 설명했다. 반면 모든 단어를 교체하는 수준으로 완전히 재작성하면 워터마크가 사라질 수 있다고 인정했다. 회사는 이 정도로 바뀐 결과물을 계속 AI 생성 텍스트라고 부를 수 있는지는 논쟁의 여지가 있다고 덧붙였다. Claude가 사람이 쓴 글을 단순히 교정하거나 일부만 편집한 경우에는 글의 길이와 수정 강도에 따라 탐지 여부가 달라진다. 수정이 가벼워 대부분의 단어가 인간 저자의 원문으로 남아 있다면 워터마크가 붙을 부분이 거의 없거나 전혀 없을 수 있다.
5. 코드에 적용되는 범위와 제약
코드는 실행되어야 한다는 기능적 제약 때문에 Claude가 여러 개의 동등한 표현 중 자유롭게 선택할 여지가 일반 텍스트보다 작다. 따라서 Anthropic은 코드 출력에는 다른 종류의 텍스트보다 워터마크가 적게 포함될 것이라고 설명했다. 다만 코드 안에서도 특정 단어나 용어 중 하나를 임의로 선택할 수 있는 부분에는 워터마크를 사용할 수 있으며, 회사는 주석을 대표적인 사례로 들었다. Anthropic은 이런 제한적 적용이 실제로 생성되는 코드 자체에는 무시할 수 있을 정도의 영향만 준다고 밝혔다. 즉 코드에서는 작동 가능성이 우선되고, 그 범위 안에서 선택의 자유가 남는 부분에만 워터마크 패턴이 들어가는 구조다.
6. Claude를 넘어선 적용 범위
Anthropic은 워터마크가 Claude에만 적용되는 독자적인 조치로 끝나지 않을 것이라고 밝혔다. 회사에 따르면 다른 주요 모델 개발사들도 동일한 실천 규범에 서명했으며 각자의 워터마크를 구현할 예정이다. 이는 모든 회사가 SynthID-Text와 동일한 방식을 사용한다는 의미가 아니라, AI 생성 콘텐츠를 식별할 수 있는 체계를 각자 마련한다는 설명이다. 기사에서 확인되는 공통점은 규범 준수와 식별 가능성이라는 목표이며, 업체별 구현 방식이나 상호 호환성은 제시되지 않았다. 따라서 이번 발표는 Claude의 구체적인 작동 원리를 설명하는 동시에 주요 모델 개발사 전반으로 워터마크 도입이 확산될 예정임을 보여준다.
🧾 핵심 주장 / 시사점
- Claude 워터마크의 탐지 여부는 단순한 유무가 아니라 텍스트 길이, 편집 강도, 재작성 범위에 따라 달라지는 연속적인 문제다.
- 사람이 작성한 글을 Claude가 가볍게 교정한 경우에는 워터마크가 거의 남지 않을 수 있어, 탐지 결과만으로 전체 글의 작성 주체를 단순하게 판단하기 어렵다.
- 코드에서는 기능적 정확성이 표현 선택보다 우선하므로 워터마크 적용 여지가 제한되고, 상대적으로 자유로운 주석이나 용어 선택 부분이 주요 적용 대상이 된다.
✅ 액션 아이템
- Anthropic의 워터마크 탐지 API 공개 후 SynthID-Text의 키 기반 탐지와 Pangram의 문체 기반 AI 탐지 간 차이 확인이 필요함.
- Claude 텍스트의 가벼운 편집과 완전한 재작성 사이에서 워터마크 탐지 가능성이 어떻게 달라지는지 구분 검토가 필요함.
- Claude의 일반 텍스트와 코드·주석에서 워터마크 적용 강도 및 실제 코드에 대한 영향이 어떻게 다른지 확인이 필요함.
❓ 열린 질문
- Anthropic이 계획한 워터마크 탐지 API는 언제 어떤 이용 조건으로 공개될 것인가?
- Claude 텍스트의 가벼운 편집과 완전한 재작성 사이의 경계는 SynthID-Text 탐지 결과에서 어떻게 판정될 것인가?
- EU AI Act 투명성 코드에 서명한 다른 주요 모델 개발사들은 어떤 자체 워터마크 방식을 구현할 것인가?