Microsoft exec called AI scraping ‘the largest theft of labor in human history,' new unredacted filings reveal
Quick Summary
The New York Times의 저작권 소송에서 공개된 서면은 Microsoft와 OpenAI 내부에서 AI 학습용 수집을 ‘절도’, AI 제품을 언론사의 ‘존립 위협’으로 표현했다고 전하지만, 상당수 내용은 원고 측 주장이고 기초 증거와 인용의 원래 맥락은 공개되지 않았다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
The New York Times의 저작권 소송에서 공개된 서면은 Microsoft와 OpenAI 내부에서 AI 학습용 수집을 ‘절도’, AI 제품을 언론사의 ‘존립 위협’으로 표현했다고 전하지만, 상당수 내용은 원고 측 주장이고 기초 증거와 인용의 원래 맥락은 공개되지 않았다.
📌 핵심 요약
- 2026년 9월 17일 보도에 따르면, The New York Times가 OpenAI와 Microsoft를 상대로 3년 전 제기한 저작권 소송에서 가림 처리되지 않은 내용이 공개됐다. 새로운 정보 상당수는 The Times 측 서면에서 나왔으며, 기초 증거자료는 여전히 봉인돼 있다.
- 저작권 자료를 AI 학습에 사용하는 행위의 적법성은 명확히 결론 나지 않았다. 기사에 따르면 판사들은 대체로 AI 기업의 공정 이용 주장에 우호적이었고, 트럼프 행정부도 이달 초 OpenAI의 무허가 학습을 옹호하는 서면을 제출했다.
- Microsoft 내부 자료에서는 Copilot이 기존 Bing 검색보다 The New York Times 도메인의 클릭률을 최대 93% 낮춘 것으로 나타났다. Brent Hecht는 이를 모델 성능과 웹 전체를 함께 해치는 ‘악순환’으로 설명했고, OpenAI의 Nick Turley는 ChatGPT 같은 제품이 언론 콘텐츠를 상당 부분 대체하며 언론사의 존립을 위협한다고 표현했다.
- Satya Nadella는 유료벽 뒤 콘텐츠를 그라운딩이나 학습에 쓰려면 라이선스를 받아야 한다고 증언했다. 서면은 OpenAI의 유료벽 우회와 저작권 고지의 의도적 제거를 주장하며, Nadella는 유료 콘텐츠의 무단 수집·학습을 알았다면 OpenAI에 모델 재학습을 요구할 권리를 행사했을 것이라고 밝혔다.
- 서면에 따르면 OpenAI의 중간 학습 데이터셋에는 NYT, Daily News, Center for Investigative Reporting 작품의 복제본이 91,692개 넘게, Common Crawl 기반 데이터셋에는 nytimes.com 문서가 200만 개 넘게 포함됐다. Project Mango 데이터셋에는 해당 언론사들의 서로 다른 작품 최소 160,903개가 포함됐다는 의혹이 제기됐고, Brent Hecht는 2023년 메모에서 수집 관행을 ‘인류 역사상 최대 규모의 노동 절도’라고 표현했다.
🧩 주요 포인트
- Copilot의 클릭률 최대 93% 감소와 ChatGPT의 대체성에 관한 내부 발언 → 원저작물 시장의 대체·피해 여부를 둘러싼 공정 이용 공방의 핵심 근거.
- Satya Nadella의 라이선스 필요성 증언과 유료벽 우회·저작권 고지 제거 의혹 → 콘텐츠 이용에 관한 내부 입장과 실제 수집 관행 사이의 긴장이 쟁점.
- 대규모 학습 데이터와 Brent Hecht의 ‘노동 절도’ 표현 → 콘텐츠 공급자의 경제적 기반을 훼손할 위험이 부각되지만, 원고 측 서면과 봉인된 기초 증거는 구분해 해석할 필요.
🧠 상세 정리
1. 공개된 소송 서면과 증거의 한계
2026년 9월 17일 TechCrunch 보도는 The New York Times가 OpenAI와 Microsoft를 상대로 3년 전 제기한 저작권 소송에서 새롭게 공개된 내용을 다룬다. 소송은 두 회사가 신문 콘텐츠로 생성형 AI 모델을 학습시켜 저작권을 침해했다는 주장으로 시작됐다. 이번 서면에는 Microsoft 고위 임원이 학습 관행을 ‘절도’로 표현하고, OpenAI 지도부가 AI 제품을 언론사와 기자의 ‘존립 위협’으로 평가했다는 내용이 담겼다. 다만 새로운 정보 상당수는 The Times 측 서면에서 나온 것이며, 그 근거가 되는 증거자료는 여전히 봉인돼 있다. 따라서 기사에 제시된 인용은 원래 맥락을 확인할 수 없는 상태로, 이를 법원이 확정한 사실이나 위법성 판단과 동일시해서는 안 된다.
2. 공정 이용 방어와 시장 피해 쟁점
기사는 저작권이 있는 자료를 허락 없이 AI 학습에 사용할 수 있는지에 아직 명확한 법적 답이 없다고 설명한다. 공정 이용은 패러디, 보도, 비평 등 일정한 경우에 저작권자의 허락 없이 저작물을 이용할 수 있도록 하는 법리이며, 판사들은 대체로 AI 기업의 학습 관련 공정 이용 주장에 우호적이었다고 전한다. 트럼프 행정부도 이달 초 OpenAI가 허가받지 않은 저작권 자료로 대규모 언어 모델을 학습하는 것을 옹호하는 서면을 제출했다. 그러나 기사는 이번에 공개된 내부 발언 일부가 OpenAI의 방어 논리와 충돌한다고 분석한다. 특히 AI 제품이 원저작물을 대체하거나 그 시장에 피해를 주는지에 관한 내부 인식은 공정 이용 판단을 둘러싼 중요한 쟁점으로 제시된다.
3. Copilot의 유입 감소와 콘텐츠 공급의 악순환
서면에 인용된 Microsoft 자체 자료에 따르면 Copilot의 ‘답변 엔진’은 기존 Bing 검색과 비교해 The New York Times 도메인의 클릭률을 최대 93% 낮췄다. Microsoft 응용과학 책임자 Brent Hecht가 2024년 1월 작성한 내부 발표자료는 이를 모델 성능과 웹 전체를 동시에 해치는 ‘악순환’이라고 설명했다. 해당 문서는 완성된 제품이 필수 공급자의 경제적 기반을 위협하는 상황은 매우 이례적이지만, 대규모 언어 모델 사업의 콘텐츠 공급 관계에서 바로 그런 상황을 만들었다고 지적했다. 이는 AI가 답변을 직접 제공할 때 원문으로 향하는 이용자 유입이 줄어들 수 있다는 내부 우려를 보여준다. 기사는 이 자료를 통해 언론사의 시장 피해와 모델이 의존하는 콘텐츠 공급 기반의 약화가 연결돼 있음을 드러낸다.
4. 라이선스 필요성 증언과 뉴스 대체성 인정
Microsoft CEO Satya Nadella는 올해 증언에서 유료벽 뒤에 있는 콘텐츠를 그라운딩이나 학습에 사용하려면 누구든 라이선스를 받아야 한다고 말했다. 또한 OpenAI가 유료벽 뒤 정보를 수집해 학습했다는 사실을 알았다면, Microsoft의 권리를 행사해 모델 재학습을 요구했을 것이라고 밝혔다. OpenAI의 ChatGPT 책임자 Nick Turley는 내부 소통에서 챗봇 같은 제품이 언론 콘텐츠를 상당 부분 대체하며, 성능이 좋아질수록 대체성이 더 커져 언론사에 ‘존립 위협’이 된다고 표현했다. OpenAI 사장 Greg Brockman은 모델이 뉴스에 뛰어나다고 평가했고, Nadella 역시 챗봇이 원문 사이트 방문을 대신해 AI 플랫폼에서 정보를 제공한다는 점을 인정했다. 기사는 이런 발언이 원저작물의 변형보다는 직접 경쟁 가능성을 보여준다고 분석하며, Microsoft 문서에는 학습 데이터를 만든 사람들의 고용이 크게 흔들릴 수 있다는 우려도 담겼다고 전한다.
5. 복제 규모와 두 회사의 학습 데이터 교환
공개된 서면에 따르면 OpenAI의 중간 학습 데이터셋에만 NYT, Daily News, Center for Investigative Reporting이 발행한 작품의 복제본이 91,692개 넘게 들어 있었다. Common Crawl에서 파생된 데이터셋에는 nytimes.com의 문서가 200만 개 넘게 포함됐다. Brent Hecht는 2023년 1월 내부 메모에서 이러한 관행을 전례 없는 규모의 놀라운 절도이자 ‘인류 역사상 최대 규모의 노동 절도’라고 표현했다. 서면은 Bing Index를 통한 콘텐츠 수집도 설명하며, OpenAI가 GPT-3 학습 데이터셋 전체를 Microsoft에 전달했고 Microsoft는 자사 상용 제품에 모델을 적용하는 방식을 평가하는 데 사용했다고 주장한다. Microsoft 역시 Project Taxi와 Project Mango를 통해 OpenAI에 학습 데이터를 제공했으며, Project Mango 데이터로 구성된 학습 데이터셋에는 해당 언론사들의 서로 다른 작품 최소 160,903개가 포함됐다는 의혹이 제기됐다.
6. 유료벽 우회와 저작권 고지 제거 의혹
서면은 OpenAI 직원들이 탐지되지 않은 채 유료벽을 우회하기 위한 방안을 마련했다고 주장한다. 연구원 Nick Ryder가 nytimes 유료벽을 피하는 ‘해킹 방법’을 알리자 Greg Brockman이 ‘아, 좋네’라고 답했다는 대화도 제시됐다. 또한 직원들이 수집한 뉴스 콘텐츠에 불균형하게 의존하는 WebText와 WebText2를 구축하고, 무료 공개 웹 수집 저장소인 Common Crawl에서 수백만 건의 기사를 가져왔다는 의혹이 담겼다. 연구원들이 모델이 사용자에게 저작권 고지를 출력하는 것을 원하지 않아, 데이터가 모델에 도달하기 전에 고지를 의도적으로 제거했다는 내용도 포함됐다. New York Daily News 측 변호사 Steven Lieberman은 이 증거가 두 회사가 잘못을 알고 있었다는 점을 보여준다고 주장했으나, 이는 원고 측의 평가다. OpenAI와 Microsoft는 TechCrunch의 논평 요청에 응답하지 않았다.
🧾 핵심 주장 / 시사점
- 시장 대체성에 관한 내부 발언과 클릭률 자료가 함께 제시되면서, 논쟁은 학습용 복제의 적법성뿐 아니라 AI 제품이 원문 콘텐츠의 경제적 가치를 훼손하는지로 이어진다.
- Brent Hecht의 ‘악순환’ 설명은 콘텐츠 공급자의 피해가 장기적으로 모델 성능과 웹에도 부담을 줄 수 있다는 Microsoft 내부의 우려를 드러낸다.
- 강한 표현의 내부 인용이 공개됐더라도 원고 측 서면, 봉인된 기초 증거, 법원의 판단은 서로 구분해야 하며, 원래 맥락이 없는 인용만으로 위법성을 확정할 수는 없다.
✅ 액션 아이템
- 공정 이용 쟁점을 검토할 때 Copilot의 클릭률 최대 93% 감소와 ChatGPT의 대체성 발언을 시장 피해 근거로 함께 검토.
- Satya Nadella의 라이선스 필요성 증언과 유료벽 우회·저작권 고지 제거 의혹 사이의 관계를 검토.
- The New York Times 측 서면의 주장과 봉인된 기초 증거를 구분하고, 인용의 원래 맥락이 공개되지 않았다는 한계를 명시.
❓ 열린 질문
- Copilot의 클릭률 최대 93% 감소와 ChatGPT의 대체성 발언은 공정 이용 판단에서 어떤 비중으로 평가될까?
- Satya Nadella의 라이선스 필요성 증언은 유료벽 우회·저작권 고지 제거 의혹에 관한 판단에 어떤 영향을 미칠까?
- 봉인된 기초 증거와 인용의 원래 맥락이 공개되면 The New York Times 측 서면의 주장은 얼마나 뒷받침될까?