Articleblog.cloudflare.com·2026년 4월 17일·6

Redirects for AI Training enforces canonical content

Quick Summary

Cloudflare는 AI 학습 크롤러가 오래된 문서를 그대로 학습하지 않도록 기존 canonical 태그를 검증된 AI 학습 크롤러 대상 HTTP 301 리디렉션으로 강제하는 Redirects for AI Training을 출시했다.

Redirects for AI Training enforces canonical content 관련 대표 이미지

🖼️ 인포그래픽

Redirects for AI Training enforces canonical content 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Redirects for AI Training enforces canonical content의 핵심 내용을 4단계로 요약한 인포그래픽
Redirects for AI Training enforces canonical content 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

Cloudflare는 AI 학습 크롤러가 오래된 문서를 그대로 학습하지 않도록 기존 canonical 태그를 검증된 AI 학습 크롤러 대상 HTTP 301 리디렉션으로 강제하는 Redirects for AI Training을 출시했다.

📌 핵심 요약

  • Cloudflare는 Wrangler CLI의 오래된 문서처럼 deprecation 배너, noindex, canonical 태그가 모두 있어도 AI 학습 크롤러가 이를 안정적으로 따르지 않는 문제를 제기했다.
  • developers.cloudflare.com에서 AI Crawl Control로 확인한 결과, AI Crawler Category 봇은 최근 30일 동안 480만 회 방문했고 오래된 콘텐츠를 최신 콘텐츠와 같은 비율로 소비했다.
  • Redirects for AI Training은 검증된 AI 학습 크롤러가 비자기참조 canonical 태그가 있는 페이지에 접근하면 HTML을 반환하기 전에 canonical URL로 301 Moved Permanently를 보내도록 만든다.
  • 이 기능은 GPTBot, ClaudeBot, Bytespider 같은 AI 학습용 크롤러에 적용되며, 사람 방문자·검색 색인·AI Assistant 및 AI Search 범주의 에이전트 트래픽에는 영향을 주지 않는다.
  • Cloudflare는 Radar AI Insights에 AI 크롤러가 받는 2xx·3xx·4xx·5xx 응답 상태 코드 분석을 추가해, 사이트 운영자가 AI 크롤러에 실제로 어떤 정책 신호를 보내고 있는지 볼 수 있게 했다.

🧩 주요 포인트

  1. Cloudflare는 Wrangler CLI의 오래된 문서처럼 deprecation 배너, noindex, canonical 태그가 모두 있어도 AI 학습 크롤러가 이를 안정적으로 따르지 않는 문제를 제기했다.
  2. developers.cloudflare.com에서 AI Crawl Control로 확인한 결과, AI Crawler Category 봇은 최근 30일 동안 480만 회 방문했고 오래된 콘텐츠를 최신 콘텐츠와 같은 비율로 소비했다.
  3. Redirects for AI Training은 검증된 AI 학습 크롤러가 비자기참조 canonical 태그가 있는 페이지에 접근하면 HTML을 반환하기 전에 canonical URL로 301 Moved Permanently를 보내도록 만든다.
  4. 이 기능은 GPTBot, ClaudeBot, Bytespider 같은 AI 학습용 크롤러에 적용되며, 사람 방문자·검색 색인·AI Assistant 및 AI Search 범주의 에이전트 트래픽에는 영향을 주지 않는다.
  5. Cloudflare는 Radar AI Insights에 AI 크롤러가 받는 2xx·3xx·4xx·5xx 응답 상태 코드 분석을 추가해, 사이트 운영자가 AI 크롤러에 실제로 어떤 정책 신호를 보내고 있는지 볼 수 있게 했다.

🧠 상세 정리

1. 오래된 문서가 AI 학습 데이터로 남는 문제

Cloudflare는 Wrangler CLI가 지난 6년 동안 여러 주요 버전을 거치며 명령어와 설정 방식이 바뀌었고, 그 과정에서 오래된 문서도 계속 보존해 왔다고 설명한다. 해당 v1 문서에는 deprecation 배너, noindex 메타 태그, 최신 문서를 가리키는 canonical 태그가 붙어 있어 사람과 검색엔진에는 “이 콘텐츠는 오래됐다”는 신호를 보낸다. 그러나 AI 학습 크롤러는 이런 안내 신호를 안정적으로 따르지 않았고, 결과적으로 오래된 문서를 최신 문서와 비슷하게 수집했다. 문제는 AI 에이전트가 항상 실시간으로 웹을 다시 가져오는 것이 아니라 학습된 모델의 기반 지식에 의존한다는 점이다. 오래된 문서가 학습되면 이후 에이전트의 답변도 낡은 전제를 물려받을 수 있다.

2. AI Crawl Control로 확인한 실제 크롤링 양상

Cloudflare는 developers.cloudflare.com에서 AI Crawl Control을 사용해 AI Crawler Category 봇의 접근을 관찰했다. 최근 30일 동안 이 범주의 봇은 480만 회 방문했으며, 오래된 콘텐츠를 최신 콘텐츠와 같은 비율로 소비했다. Cloudflare가 보기에 deprecation 배너, noindex, canonical 태그 같은 기존의 권고형 신호는 AI 학습 크롤러의 수집 행태에 측정 가능한 차이를 만들지 못했다. 특히 학습 크롤러가 페이지의 전체 텍스트를 가져갈 경우, 경고 배너도 단순히 본문 중 하나의 문단처럼 취급될 위험이 있다. 따라서 Cloudflare는 단순 안내가 아니라 크롤러가 실제로 받는 응답 자체를 바꾸는 방식이 필요하다고 본다.

3. noindex와 robots.txt만으로 부족한 이유

검색엔진 환경에서는 noindex가 비교적 풍부한 신호 체계로 작동하지만, 페이지 안에 “이 내용으로 학습하지 말라”고 말하는 동등한 표준 지시자는 없다고 글은 지적한다. 오래된 페이지를 경고 배너와 함께 유지하는 방식은 사람이 직접 읽을 때는 작동할 수 있지만, AI 학습 크롤러에는 충분하지 않다. 반대로 크롤러를 완전히 차단하면 무엇을 대신 학습해야 하는지에 대한 신호가 사라지는 공백이 생긴다. robots.txt도 일부 보호를 제공하지만, 크롤러별·경로별·콘텐츠 갱신별 지시를 계속 관리하려면 운영 부담이 커진다. Cloudflare가 제안하는 핵심은 차단이나 권고가 아니라 “현재 콘텐츠는 여기 있다”는 구체적 방향을 크롤러에 강제하는 것이다.

4. canonical 태그를 강제 신호로 바꾸는 접근

Redirects for AI Training은 이미 많은 사이트가 갖고 있는 canonical 태그를 기반으로 작동한다. 글은 RFC 6596에 정의된 link rel="canonical" 태그가 어떤 URL이 페이지의 권위 있는 버전인지를 검색엔진과 자동화 시스템에 알려주는 HTML 요소라고 설명한다. 이 태그는 이미 웹페이지의 65~69%에 존재하며, EmDash, WordPress, Contentful 같은 플랫폼에서 자동 생성되기도 한다. 기존 canonical 태그가 콘텐츠의 최신 위치를 선언하는 인프라라면, Cloudflare의 새 기능은 그 선언을 AI 학습 크롤러에게 실제 301 리디렉션으로 집행한다. 즉 사이트 운영자가 별도의 경로 매핑을 새로 만들지 않아도, 이미 있는 콘텐츠 계층을 활용할 수 있게 한다.

5. Redirects for AI Training의 작동 방식

이 기능은 Cloudflare의 cf.verified_bot_category 필드와 HTML 안의 canonical 태그라는 두 가지 입력을 사용한다. AI Crawler category에는 GPTBot, ClaudeBot, Bytespider처럼 AI 모델 학습을 위해 크롤링하는 봇이 포함되며, AI Assistant나 AI Search 범주의 AI 에이전트와는 구분된다. 검증된 AI Crawler 요청이 들어오면 Cloudflare는 응답 HTML을 읽고, 자기 자신을 가리키지 않는 canonical 태그가 있는지 확인한다. 그런 태그가 있으면 원래 응답을 돌려주기 전에 301 Moved Permanently와 canonical URL을 Location으로 반환한다. 글의 예시에서는 GPTBot이 오래된 Durable Objects 경로를 요청했을 때 최신 sqlite-storage-api 문서로 301 리디렉션되는 흐름이 제시된다.

6. 적용 범위와 의도적으로 제외한 경우

Cloudflare는 이 기능이 이미 학습 데이터에 들어간 내용을 소급해 고치지는 못한다고 분명히 밝힌다. 또한 AI Crawler bot category 밖에 있는 검증되지 않은 크롤러에는 적용되지 않으며, 사람 방문자와 AI Agents가 오래된 페이지를 방문하는 경우에도 리디렉션하지 않는다. 교차 출처 canonical, 즉 다른 도메인의 선호 URL을 가리키는 태그도 제외되는데, 이는 종종 콘텐츠 신선도보다 도메인 통합 목적으로 사용되기 때문이다. 자기 자신을 가리키는 self-referencing canonical도 루프를 피하기 위해 리디렉션을 유발하지 않는다. 따라서 이 기능은 모든 자동화 트래픽을 통제하는 만능 차단 장치가 아니라, 검증된 AI 학습 크롤러가 같은 출처의 최신 canonical 콘텐츠를 받도록 하는 좁은 목적의 집행 장치다.

7. 일반 Redirect Rules와 비교한 차이

글은 Cloudflare의 Single Redirect Rules로도 사용자 에이전트 문자열을 기준으로 AI 크롤러를 겨냥할 수는 있다고 인정한다. 오래된 경로가 몇 개뿐인 사이트라면 그런 방식도 작동할 수 있다. 그러나 오래된 경로가 계속 늘어나면 매번 규칙을 추가해야 하고, 사용자 에이전트도 수동으로 추적해야 하며, 캠페인 URL이나 도메인 이전 등에 쓸 수 있는 플랜 한도를 소모하게 된다. 더 중요한 문제는 Redirect Rules가 canonical 태그가 이미 선언한 정보를 다시 수동으로 인코딩한다는 점이다. 콘텐츠가 바뀔수록 수동 리디렉션 규칙은 canonical 구조와 어긋날 수 있으므로, Cloudflare는 자동으로 canonical을 집행하는 방식이 더 확장 가능하다고 설명한다.

8. Cloudflare 문서 사이트에서 관찰한 사례

Cloudflare는 자체 문서 사이트에서도 문제가 실제로 발생했다고 말한다. 2026년 3월 legacy Workers 문서는 OpenAI에 약 4만6000회, Anthropic에 3600회, Meta에 1700회 크롤링되었다. 이후 2026년 4월 한 주요 AI 어시스턴트에게 Wrangler CLI로 KV 값을 쓰는 방법을 물었을 때, 이 어시스턴트는 오래된 kv:key put 문법을 답했다. 실제로 2026년 4월 기준 올바른 문법은 wrangler kv key put이며, 콜론이 들어간 문법은 Wrangler 3.60.0에서 deprecated 처리되었다. Cloudflare는 문서 안에 deprecation notice가 있었지만, 학습 파이프라인이 이를 어떻게 해석하는지는 불명확하다고 설명한다.

9. 기능 활성화 후 초기 결과와 한계 있는 기대

Cloudflare는 developers.cloudflare.com에서 Redirects for AI Training을 활성화한 뒤 처음 7일 동안 측정한 결과를 제시한다. 비자기참조 canonical 태그가 있는 페이지에 대한 AI 학습 크롤러 요청은 100% 리디렉션되었고, 오래된 콘텐츠는 제공되지 않았다. Cloudflare는 이런 리디렉션이 시간이 지나면 legacy 도구에 대한 AI 생성 답변을 개선할 것으로 기대하지만, 이를 확정된 결과로 단정하지는 않는다. 학습 파이프라인은 폐쇄적이고 재크롤링 시점도 다양하기 때문에, 실제 답변 품질 개선은 계속 검증해야 할 가설로 남아 있다. 다만 접근 시점에서 크롤러가 받는 콘텐츠가 즉시 개선되었다는 점은 확인된 효과로 제시된다.

10. Radar AI Insights의 응답 상태 코드 분석

Cloudflare는 Redirects for AI Training과 함께 Radar AI Insights에 Response status code analysis를 추가했다. 이 분석은 AI 크롤러가 Cloudflare 전체 트래픽에서 어떤 상태 코드를 받는지, 즉 2xx 성공, 3xx 리디렉션, 4xx 클라이언트 오류, 5xx 서버 오류의 분포를 보여준다. 예시 그래프에서는 전체 AI 크롤러 요청 중 200 응답이 70% 조금 넘고, 301·302 리디렉션이 10.1%, 404가 3.7%, 403 차단이 8.3%로 나타난다. 그룹 기준으로는 약 74%가 2xx, 13.7%가 4xx, 11.3%가 3xx, 1.2%가 5xx 응답을 받았다. GPTBot 개별 페이지 예시도 제공되어, 특정 봇의 성공·차단·리디렉션·오류 분포를 따로 볼 수 있으며 Data Explorer와 Radar API를 통한 추가 분석도 가능하다고 설명한다.

🧾 핵심 주장 / 시사점

  • 이 글의 핵심은 AI 크롤러 통제에서 권고형 HTML 신호만으로는 부족하며, 크롤러가 실제로 받는 HTTP 응답을 정책 집행 수단으로 바꿔야 한다는 점이다.
  • Cloudflare는 오래된 문서 차단보다 최신 canonical 문서로의 안내를 선택함으로써, AI 학습 데이터의 공백을 만들지 않고 더 나은 대체 콘텐츠를 제공하려는 방향을 제시한다.
  • Radar의 상태 코드 분석은 개별 사이트 기능을 넘어, 웹 전체가 AI 크롤러에 대해 허용·차단·리디렉션·오류로 어떻게 대응하고 있는지 관찰하는 계량적 도구로 확장된다.

✅ 액션 아이템

  • Cloudflare의 AI 학습 크롤러 대상 301 Redirects를 기존 canonical 정책과 연동해 비자기참조 페이지 처리 방식을 정한다.
  • AI Crawler Category의 최근 30일 480만 회 방문 데이터를 기준으로 오래된 페이지 소비 비율 추이를 추적한다.
  • Radar AI Insights의 2xx·3xx·4xx·5xx 응답 분석을 통해 GPTBot·ClaudeBot·Bytespider에 전달되는 정책 신호 상태를 점검한다.

❓ 열린 질문

  • 검증된 AI 학습 크롤러가 canonical 미일치 페이지에 도달할 때 301 전환이 실제로 오래된 문서 학습 확산을 줄일 것인가?
  • 사람 방문자·검색 색인·AI Assistant 및 AI Search 트래픽을 제외한 범위 설정이 운영 정책상 충돌 없이 유지되는가?
  • 오래된 콘텐츠가 최신 콘텐츠와 같은 비율로 소비된다는 패턴이 자사 사이트/도메인에서도 동일하게 나타나는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.