Articleopenai.com·2026년 10월 5일·0

Our approach to EU text provenance rules

Quick Summary

OpenAI는 EU AI Act에 대응해 textGrain 텍스트 워터마킹을 단계적으로 도입하되, 검출의 오류와 해석 한계를 고려해 EU의 ChatGPT·Codex 적용, 전 세계 API 선택 참여, 제한된 검출기 접근을 추진한다.

Our approach to EU text provenance rules 관련 대표 이미지

🖼️ 인포그래픽

Our approach to EU text provenance rules 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Our approach to EU text provenance rules의 핵심 내용을 4단계로 요약한 인포그래픽
Our approach to EU text provenance rules 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

OpenAI는 EU AI Act에 대응해 textGrain 텍스트 워터마킹을 단계적으로 도입하되, 검출의 오류와 해석 한계를 고려해 EU의 ChatGPT·Codex 적용, 전 세계 API 선택 참여, 제한된 검출기 접근을 추진한다.

📌 핵심 요약

  • OpenAI는 2026년 10월 5일 EU AI Act의 기계 판독 가능한 생성 텍스트 식별 요구에 대응하는 방침을 발표했다. 향후 몇 주 동안 EU 내 모든 요금제의 적용 대상 ChatGPT·Codex 텍스트 출력에 보이지 않는 워터마크를 도입하며, 전 세계 API 고객은 발표일부터 일부 모델에서 선택 참여할 수 있다. API에서는 기본적으로 비활성화되고, 출시 시 전 세계 기본 적용은 하지 않는다.
  • textGrain은 모델의 단어 선택에 보이지 않는 통계적 신호를 추가하며, 검출기는 OpenAI 워터마크의 존재 여부를 평가한다. 검출기 접근 신청은 발표일부터 받지만 초기 접근은 승인된 연구자와 전문 기관에 개별적으로 허용한다. OpenAI는 기술 보고서에 추가 내용을 공개하고 기술을 오픈 소스로 제공할 계획이다.
  • 목표 위양성률 1%에서 심리학 같은 내용의 워터마크 검출률은 200토큰 구절에서 약 80%, 400토큰에서 약 95%였으며, 단어 선택의 여지가 적은 수학에서는 상당히 낮았다. 별도의 400토큰 구절 평가에서는 단어의 10%를 동의어로 바꾸면 검출률이 약 92%에서 66%로, 25%를 바꾸면 17%로 떨어졌다.
  • OpenAI는 최신 프런티어 모델 Astra의 평가 벤치마크에서 워터마킹 적용 전후 의미 있는 성능 차이를 관찰하지 못했다고 밝혔다. 다만 이상적인 조건에서의 높은 검출 성능이 일상적인 사용에서의 신뢰성을 보장하지는 않으며, 검출기는 위양성과 위음성을 모두 낼 수 있다.
  • 워터마크는 OpenAI 시스템이 텍스트 일부를 생성하거나 처리했을 가능성에 관한 제한된 신호다. 사람의 기여도, 소유권·책임, 사용자 신원, 내용의 정확성을 판단하지 못하며, 검출되지 않았다고 사람이 작성했음을 입증하지도 못한다. OpenAI는 이미지·오디오에 쓰는 공개 검증 도구와 개방형 표준을 포함한 다층적 출처 확인 방식을 유지하고, 증거·표준·규제 변화에 따라 접근 방식을 재검토할 예정이다.

🧩 주요 포인트

  1. EU 의무 적용과 API 선택 참여의 병행 → 규제 요구에 대응하면서 지역별 도입 경험과 고객의 투명성 의무를 반영한다.
  2. textGrain의 길이·내용·편집 민감성과 위양성·위음성 → 검출 결과의 신뢰성과 책임 있는 해석을 평가하기 위해 초기 접근을 제한한다.
  3. Astra의 성능 유지와 워터마크의 제한된 증명 범위 → 모델 성능에 관한 평가와 작성 주체·정확성에 관한 판단을 구분하고, 여러 출처 확인 수단을 함께 사용한다.

🧠 상세 정리

1. EU 규제 대응과 단계적 도입의 배경

OpenAI는 2026년 10월 5일 콘텐츠의 출처와 생성·편집 과정을 이해하도록 돕는 출처 확인 작업의 일부로 텍스트 워터마킹 방침을 발표했다. 이미 자사 모델이 생성한 이미지와 오디오를 식별하는 도구를 공개했으며, 이번 발표는 EU AI Act에 대응하는 텍스트 식별 방식에 초점을 맞춘다. EU AI Act는 생성형 AI 제공자가 생성된 텍스트를 기계 판독 가능한 방식으로 식별할 수 있게 할 것을 요구한다. 그러나 텍스트 워터마킹과 검출은 아직 초기 기술로 상당한 한계가 있고, 그 이점과 책임 있는 사용에 관한 견해도 발전 중이다. 이에 OpenAI는 규제 요구와 기술의 한계를 함께 반영해 단계적으로 도입하고, 워터마크가 알려줄 수 있는 것과 알려줄 수 없는 것을 투명하게 설명한다는 방향을 제시했다.

2. textGrain의 작동 방식과 공개 계획

textGrain은 모델이 단어를 선택하는 과정에 보이지 않는 통계적 신호를 추가하는 OpenAI의 텍스트 워터마킹 기술이다. 검출기는 이 신호를 찾아 특정 구절에 OpenAI 워터마크가 포함되어 있는지 평가한다. OpenAI의 평가에서 textGrain은 텍스트용 SynthID를 포함해 시험한 다른 접근 방식과 같거나 더 높은 성능을 보였지만, 이상적인 조건에서의 성능이 일상적인 사용에서의 안정적인 검출을 보장하지는 않는다. 작동 방식에 관한 기술 보고서는 공개되어 있으며, 향후 몇 주 동안 추가 세부 정보로 갱신될 예정이다. 다른 이들이 이 기술을 기반으로 발전시킬 수 있도록 오픈 소스로 제공할 계획도 밝혔다. 이러한 성능 주장과 공개 계획은 기술의 발전 가능성을 설명하지만, 현재 검출 결과의 신뢰성에 관한 한계를 없애지는 않는다.

3. 텍스트 길이·내용·편집에 따른 검출 한계

검출기는 워터마크가 없는데 있다고 판단하는 위양성과, 워터마크가 있는데 놓치는 위음성을 모두 낼 수 있다. 목표 위양성률 1%에서 심리학 같은 내용의 워터마크 검출률은 200토큰 구절에서 약 80%, 400토큰 구절에서 약 95%였으며, 단어 선택의 유연성이 낮은 수학에서는 상당히 낮았다. 길이와 내용에 관한 도표는 ELI5 데이터셋의 수학·심리학 질문에 대한 워터마크가 있는 응답을 사용했으며, 텍스트가 길어질수록 검출이 개선되는 경향을 보여준다. 별도의 400토큰 구절 평가에서는 단어의 10%를 동의어로 바꾸자 검출률이 약 92%에서 66%로 떨어졌고, 25%를 바꾸자 17%로 떨어졌다. 편집에 관한 도표의 결과는 ELI5 질문에 대한 워터마크가 있는 영어 응답을 기반으로 한다. OpenAI는 이런 한계 때문에 초기 검출기 접근을 승인된 연구자와 전문 기관에 제한하고, 이들과 신뢰성 및 책임 있는 사용을 평가한다고 설명한다.

4. Astra 벤치마크에서 관찰한 모델 성능

OpenAI는 최신 프런티어 모델 Astra를 평가하는 벤치마크 전반에서 워터마킹 유무에 따른 의미 있는 성능 차이를 관찰하지 못했다고 밝혔다. Astra의 max 설정에서 워터마크 미적용과 적용 결과는 각각 Artificial Analysis Intelligence Index 49.57점과 49.76점, AutomationBench 34.09%와 34.86%였다. DeepSWE v1.1은 72.80%와 71.68%, Terminal-Bench 4.0은 53.90%와 56.06%, Terminal-Bench Science 0.1은 56.90%와 60.00%였다. BrowseComp는 87.92%와 87.35%, HealthBench Professional은 64.27%와 64.60%, GPQA Diamond는 94.44%와 93.94%였다. 개별 점수는 적용 후 높아지거나 낮아졌지만, 원문은 이를 종합해 의미 있는 성능 차이가 보이지 않았다고 설명한다. 이 평가는 모델의 벤치마크 성능에 관한 것으로, 편집되거나 짧은 텍스트에서 워터마크를 안정적으로 검출할 수 있다는 보장은 아니다.

5. 검출 결과로 판단할 수 있는 범위

텍스트 워터마크는 특정 구절에서 OpenAI 시스템이 수행한 역할에 관한 제한된 신호를 제공한다. 시스템이 텍스트 일부를 생성하거나 처리했음을 나타낼 수는 있지만, 사람이 얼마나 판단하고 편집하며 창의성을 발휘했는지는 측정하지 못한다. 또한 텍스트의 소유권, 사용의 적법성, 공개 의무의 존재 여부, 책임 주체를 결정하지 않으며, 사람·조직·계정·프롬프트·대화를 해당 텍스트와 연결하지도 않는다. 내용이 사실인지, 오해를 유발하거나 유해한지, 적절한 맥락에서 제시되었는지도 검증하지 못한다. 워터마크가 검출되지 않았다는 사실 역시 사람이 작성했다는 증거가 될 수 없다. OpenAI 도구로 생성한 텍스트도 너무 짧거나 편집·번역되어 검출이 어려울 수 있고, 지원하지 않는 모델의 출력이거나 워터마킹 도입 이전에 생성되었을 수 있으며, 다른 회사의 도구로 생성되었을 가능성도 있다.

6. ChatGPT·Codex·API와 검출기의 적용 범위

OpenAI는 향후 몇 주 동안 EU 내 모든 요금제의 적용 대상 ChatGPT·Codex 사용자에게 텍스트 워터마킹을 도입하며, 출시 시 이를 전 세계 기본 설정으로 적용하지는 않는다. 지역별 도입을 통해 실제 사용과 피드백에서 배울 여지를 확보한다는 설명이다. 전 세계 API 고객은 발표일부터 일부 모델의 워터마킹에 선택 참여할 수 있으며, API 기본 설정은 비활성화로 유지해 고객이 자신의 투명성 의무와 사용자 경험에 맞춰 결정하도록 한다. 클라우드 파트너의 서비스를 통해 접근하는 OpenAI 모델 출력에도 향후 몇 주 동안 워터마킹을 제공하기 위해 협력하고 있다. 검출기 신청은 발표일부터 받되, Code of Practice에 따라 평가와 개선을 지원할 승인된 연구자 및 전문 기관에 초기 접근을 개별적으로 허용한다. 검출기는 사용자나 프롬프트·대화를 공개하지 않고 OpenAI 워터마크의 검출 여부를 보고하며, 누락과 위양성의 위험 때문에 출시 시 일반 공개하지 않는다.

7. 다층적 출처 확인과 향후 개선 방향

OpenAI는 단일 출처 확인 기술만으로는 충분하지 않으므로 개방형 표준, 지속성을 갖춘 워터마킹, 검증 도구를 결합한다고 설명한다. 지원되는 이미지 출력에는 Content Credentials를 추가하고 C2PA를 준수하며, 지원되는 이미지와 오디오에는 보이지 않는 SynthID 워터마크를 삽입한다. 이미지·오디오 검증은 openai.com/verify와 Content Provenance API를 통해 계속 공개적으로 제공되며, Content Credentials가 파일의 출처와 이력을 기록하는 동안 보이지 않는 워터마크는 메타데이터가 제거되어도 신호를 남길 수 있어 서로 보완한다. 출처 확인은 딥페이크를 포함한 오해를 유발할 수 있는 AI 생성 콘텐츠를 사람과 플랫폼이 평가하도록 돕고, OpenAI는 이를 정책, 악용 탐지, 신고, 조사, 집행과 함께 사용한다. 연구자·표준화 기구·플랫폼·시민사회와의 협력도 더 넓은 생태계에서 출처 확인을 유용하게 만드는 작업의 일부다. 텍스트는 쉽게 다시 쓰거나 번역·편집할 수 있으므로, OpenAI는 6월에 논의한 기술의 실질적 한계를 반영해 검출 개선과 편집·번역에 대한 내구성 연구, AI의 보조와 작성 자체를 더 의미 있게 구분하는 방법을 탐색할 계획이다. 증거·표준·규제 요구가 발전하면 접근 방식을 조정하고, 결과를 책임 있게 해석할 수 있다고 판단할 때 검출기 접근을 확대할 예정이다.

🧾 핵심 주장 / 시사점

  • EU 적용과 전 세계 API 선택 참여를 병행하는 방식은 규제 대응과 실제 사용에서의 학습을 함께 추구하며, 초기 검출기 접근 제한도 같은 단계적 접근의 일부다.
  • textGrain의 검출률은 텍스트 길이와 단어 선택의 유연성에 영향을 받고 편집으로 크게 낮아질 수 있으므로, 단일 검출 결과를 작성 주체에 관한 확정적 판단으로 해석하기 어렵다.
  • Astra에서 의미 있는 성능 차이가 관찰되지 않았다는 결과와 워터마크의 신뢰성·해석 범위는 별개의 문제이며, OpenAI는 여러 출처 확인 기술과 운영 조치를 함께 사용하는 방향을 유지한다.

✅ 액션 아이템

  • EU의 ChatGPT·Codex 적용 대상과 전 세계 API의 일부 모델 선택 참여·기본 비활성화 조건 확인.
  • textGrain 검출 결과를 해석할 때 목표 위양성률 1%, 텍스트 길이·내용·편집에 따른 검출률 변화와 위음성 가능성 반영.
  • 워터마크를 사람의 기여도, 소유권·책임, 사용자 신원, 내용의 정확성을 판단하는 근거로 확대 해석하지 않도록 제한된 증명 범위 반영.

❓ 열린 질문

  • EU의 ChatGPT·Codex 단계적 적용에서 얻는 사용 경험과 피드백은 향후 적용 범위 재검토에 어떻게 반영될 것인가?
  • textGrain의 길이·내용·편집 민감성과 위양성·위음성을 고려할 때, 검출기 접근 확대를 위해 어떤 수준의 신뢰성과 책임 있는 해석이 확보되어야 하는가?
  • 워터마크가 사람의 기여도를 측정하지 못하는 상황에서 AI의 보조와 작성 자체를 더 의미 있게 구분하려면 어떤 근거가 필요한가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.