Articleresearch.google·2026년 10월 7일·0

Does better work always mean better workers?

Quick Summary

특허 변호사를 대상으로 한 3개월 실험에서 AI는 초안 품질을 높였지만, AI 없이 발휘하는 판단력의 향상은 선임에게서만 뚜렷했고 후임은 평균적 역량 향상 없이 점수가 양극화됐다.

Does better work always mean better workers? 관련 대표 이미지

🖼️ 인포그래픽

Does better work always mean better workers? 내용을 설명하는 본문 이미지

🖼️ 4컷 인포그래픽

Does better work always mean better workers?의 핵심 내용을 4단계로 요약한 인포그래픽
Does better work always mean better workers? 핵심 내용을 4단계로 압축한 4컷 인포그래픽

💡 한 줄 요약

특허 변호사를 대상으로 한 3개월 실험에서 AI는 초안 품질을 높였지만, AI 없이 발휘하는 판단력의 향상은 선임에게서만 뚜렷했고 후임은 평균적 역량 향상 없이 점수가 양극화됐다.

📌 핵심 요약

  • Google과 정기적·비독점적으로 거래하는 11개 지식재산권 법률사무소의 변호사 133명을 대상으로 3개월 무작위 대조 실험을 실시했다. 각 사무소 변호사의 약 3분의 2에게 당시 미공개였던 Google Labs의 AI 특허 작성 도구를 제공했으며, 이 도구는 현재 Gemini Notebook의 일부다.
  • AI 접근 권한은 특허 초안 작성 점수를 10일 시점에 0.34 표준편차, 90일 시점에 0.38 표준편차 높였다. 이는 대조군 점수 분포에서 각각 백분위 순위 10포인트와 11포인트 상승에 해당하며, 낮은 점수는 줄고 좋은 점수는 늘었지만 최상위 점수의 빈도는 변하지 않았다.
  • 90일 시점에 AI 사용을 금지한 특허 수정 과제에서는 AI 접근 집단의 점수가 전체적으로 0.32 표준편차 높았으나, 이 효과는 경력 7년 이상 선임의 0.45 표준편차 향상에서 비롯됐다. 경력 7년 미만 후임에게서는 평균적 향상이 관찰되지 않았고, 매우 낮은 점수와 좋은 점수가 함께 늘었다.
  • 후임은 중요도가 낮은 문구 교정에 시간을 쓰거나 결함을 지적하고도 직접 수정하지 않는 경향을 보였으며, 이는 실험군과 대조군 모두에 나타났다. AI를 사용한 선임은 AI를 완성품 제공자가 아닌 ‘논리 감사자’로 활용했다고 설명했으며, 기초 전문성이 AI 사용을 판단력 향상으로 연결하는 요인일 가능성이 제시됐다.
  • AI를 통한 작업 성과 향상과 지속적인 전문적 판단력 형성은 서로 다른 목표이며, 특히 후임에게는 긴장이 생길 수 있다. 표본이 제한적이고 관찰 기간이 3개월에 불과하며 모델 역량과 AI 친숙도도 빠르게 변하므로, AI를 사용하는 동안의 성과와 AI 없이 수행하는 역량을 분리해 평가해야 한다.

🧩 주요 포인트

  1. 초안 작성의 저점 개선 → AI는 결과물의 품질을 고르게 높였지만, 최상위 성과의 확대까지 보여주지는 않았다.
  2. 선임과 후임의 비보조 수행 격차 → AI를 통한 반복 작업이 판단력 학습으로 이어지는지는 기존 전문성과 활용 방식에 따라 달라질 가능성이 있다.
  3. 개월 관찰과 제한된 표본 → 즉각적인 생산성 개선을 장기적인 역량 축적으로 일반화하기 어렵고, AI 없이 수행하는 역량을 별도로 확인할 필요가 있다.

🧠 상세 정리

1. 작업 성과와 전문성 학습을 구분해야 하는 이유

2026년 10월 7일 David Autor와 Tanya Rodchenko가 발표한 글은 AI가 더 좋은 결과물을 만들게 하는 것이 곧 더 유능한 전문가를 길러내는지 묻는다. 선임과 후임을 구분하는 판단력은 대개 숙련자의 지도 아래 비교적 일상적인 업무를 수천 시간 수행하며 형성되지만, AI는 이러한 현장 학습의 과정을 바꾸고 있다. 영상의학, 비즈니스 문제 해결, 구직자의 글쓰기, 법률 교육 연구에서는 AI를 훈련 과정에 신중하게 결합할 때 경험이 적은 사람의 독립적 수행 능력이 개선될 수 있다고 보고했다. 반면 소프트웨어 엔지니어, 경영 컨설턴트, 고등학생, 임상 전문가를 대상으로 한 다른 실험에서는 AI가 즉각적인 산출물을 개선해도 도구를 제거하면 그 효과가 유지되지 않는 경우가 나타났다. 저자들은 이 상반된 결과를 이해하려면 수개월의 실제 업무 사용, AI 없는 판단력 평가, 해당 분야 전문가의 맹검 채점이라는 세 요소가 함께 필요하다고 설명한다.

2. 133명의 특허 변호사를 대상으로 한 현장 실험

National Bureau of Economic Research가 발표한 논문은 전문성이 크게 요구되는 지식재산권 법률 업무에서 AI의 단기 생산성 효과와 역량 형성 효과를 함께 살폈다. 연구에는 Google과 정기적이면서 비독점적인 거래 관계를 맺고 있는 11개 지식재산권 법률사무소의 변호사 133명이 참여했다. 연구진은 각 사무소에서 약 3분의 2를 실험군으로 무작위 배정해 당시 미공개였던 Google Labs의 AI 특허 작성 보조 도구에 먼저 접근하도록 했으며, 이 도구는 현재 Gemini Notebook의 일부다. 나머지 대조군에는 AI 사용법에 관한 일부 교육을 제공했지만, 3개월의 연구 기간이 끝날 때까지 해당 도구의 사용을 허용하지 않았다. 이러한 설계는 실제 전문 업무에 AI를 지속적으로 도입했을 때 결과물의 품질과 독립적 판단력이 어떻게 달라지는지 비교하기 위한 것이었다.

3. AI는 초안 품질을 개선했지만 최상위 점수를 늘리지는 않았다

연구진은 AI 지원 시작 후 10일과 90일에 각각 서로 다른 가상 발명 자료를 제공하고 참여자에게 특허 초안을 작성하도록 했다. 독립적인 법률 전문가가 평가한 결과, AI 접근 권한은 10일 시점의 작성 점수를 0.34 표준편차 높였으며 이는 대조군 점수 분포에서 백분위 순위가 10포인트 상승한 것에 해당했다. 90일 시점에는 효과가 0.38 표준편차로 커졌고, 백분위 순위로는 11포인트 상승에 해당했으며 모든 품질 평가 차원에서 일관된 개선이 나타났다. 점수 분포에서는 낮은 평가가 줄고 좋은 평가가 늘었지만 최상위 평가의 빈도는 변하지 않았고, 하위 점수가 하위 중간 및 중간 분위로 이동하는 양상이 관찰됐다. 이러한 패턴은 후임에게 특히 뚜렷했으며, 후임은 10일 과제에서 대조군의 평균 수행 시간인 124분보다 18분 빠르게 작업하는 등 유의한 시간 절감도 보였다.

4. AI 없는 수정 과제로 판단력의 변화를 측정

특허 변호사는 초안 작성뿐 아니라 다른 변호사의 문서에서 법정 집행 가능성을 훼손할 수 있는 중대한 오류를 찾아 고치는 업무도 수행한다. 예를 들어 발명의 신규성이나 범위를 과도하게 주장하는 표현은 문제가 될 수 있으므로, 연구진은 90일 시점에 내용과 문체상의 오류가 다수 포함된 가상 특허를 직접 표시하고 수정하는 과제를 추가했다. 이 과제는 선임이 일상적으로 발휘하며 AI에 의존할 여유가 없는 경우도 많은 전문적 판단을 모사하도록 설계됐다. 초안 작성에서는 실험군에 제공된 도구나 다른 AI 도구의 사용을 권장했지만, 수정 과제에서는 누구에게도 AI 사용을 허용하지 않아 그동안 발달한 독립적 역량을 측정했다. 제3자 특허 전문가들은 두 종류의 과제를 모두 집행 가능성, 정확성, 전략적 모호성, 완전성, 명료성의 다섯 차원에서 평가했으며, 전략적 모호성은 청구 범위를 전술적으로 설정하는 것을 뜻한다.

5. AI를 제거하자 선임과 후임의 학습 효과가 갈렸다

90일 시점의 비보조 수정 과제에서는 AI가 초안 작성에서 보여준 수준 평준화 효과가 사라졌다. AI 접근 권한을 받은 변호사의 전체 점수는 대조군보다 0.32 표준편차 높아 백분위 순위 9포인트 상승에 해당했지만, 이 효과는 전적으로 선임의 성과에서 비롯됐다. 경력 7년 이상 선임은 대조군보다 0.45 표준편차 높은 점수를 기록했으며, 이는 백분위 순위 13포인트 상승에 해당하는 반면 경력 7년 미만 후임에게서는 뚜렷한 평균적 향상이 관찰되지 않았다. 후임의 분포에서는 매우 낮은 점수와 좋은 점수가 함께 늘고 중간 수준의 점수는 줄었으며, 최상위 점수는 늘지 않았다. 저자들은 좋은 점수의 증가가 AI를 통한 학습 도약의 가능성을 시사한다고 보면서도, 낮은 점수의 증가가 보여주듯 AI 지원으로 적절한 결과물을 내는 능력이 전문성의 빠른 습득으로 이어지는 것은 아니라고 해석한다.

6. 후임에게 남은 형식 중심 편집과 실행의 어려움

질적인 편집 패턴을 살펴보면 후임은 실험군과 대조군 모두에서 문서의 처음부터 끝까지 순서대로 처리하는 경직된 형식주의를 보였다. 이들은 핵심 특허 청구항에 도달하기 전에 중요도가 낮은 도입부의 문구 교정에 시간을 소진하는 경우가 많았고, 상업적 보호 범위를 개선하기보다 표면적인 동의어 교체에 집중했다. 심각한 결함을 알아차렸을 때도 실제 문구를 고쳐 해결하는 대신 문제를 진단하는 설명형 주석만 남기는 경우가 자주 나타났다. 이러한 ‘진단하지만 실행하지 않는’ 태도는 AI를 제공받지 않은 대조군 후임에게도 비슷하게 나타났으므로, 연구진은 이를 AI가 새로 만들어낸 문제로 단정하지 않는다. 오히려 이는 후임에게 이미 존재하던 역량상의 부족이며, 3개월 동안 AI에 재작성을 맡기는 경험만으로는 그 부족이 해소되지 않았다는 것이 관찰 결과의 의미다.

7. 선임은 AI를 논리 감사자로 활용했다

AI를 사용한 선임은 후임보다 수정 과제에 더 오래 시간을 썼으며, 중요도가 낮은 문장을 지나쳐 핵심 청구항을 처음부터 다시 구성하는 방식으로 작업했다. 이들은 법적 권리를 의도치 않게 좁히거나 보호 범위를 제한할 수 있는 표현을 제거했고, 다수의 수정에 명시적인 법리를 연결했다. 후속 인터뷰에서 선임은 AI의 출력을 완성된 결과물로 받아들이기보다 자신의 논리를 검토하는 ‘논리 감사자’로 활용했다고 설명했다. 이러한 사용은 기존 문장에 대한 집착을 약화하고 구조적 수정의 이유와 방법을 명확히 설명하게 만들어, 이미 갖춘 기초 전문성을 활성화하고 날카롭게 다듬는 데 도움을 줬다는 해석이다. 저자들은 기존 전문성이 AI를 활용한 반복 경험을 숙련된 판단력으로 전환하는 연결 고리일 수 있다고 제안하지만, 이를 모든 전문가에게 적용되는 확정적인 원리로 제시하지는 않는다.

8. 장기 전문성에 대한 과제와 연구의 한계

저자들은 현재의 작업 성과를 높이는 목표와 지속적인 전문적 판단력을 형성하는 목표가 다르며, 특히 후임에게는 두 목표 사이에 긴장이 생길 수 있다고 강조한다. 모델 역량이 발전하더라도 변호사는 판사, 고객, 동료와의 상호작용에서 판단력을 사용해야 하고 모든 상황에서 AI 지원을 받을 수는 없으므로, 오늘의 좋은 결과물이 미래 전문가의 성장을 방해하지 않도록 하는 것이 과제다. 다만 이 실험의 표본은 제한적이며, 저자들은 해당 분야 최상위 전문가의 높은 시간당 청구 비용을 그 배경으로 설명하고 관찰 기간인 3개월도 지속적인 전문성 형성에 필요한 여러 해에 비해 짧다고 인정한다. 또한 지난 1년 동안 모델 역량, 기본적인 AI 친숙도, 법률 분야 AI 제품 보급이 빠르게 변화했기 때문에 지금 같은 실험을 반복하면 결과가 달라질 수 있다. 이러한 한계는 후속 연구의 기회를 제공하며, 현재 연구의 명확한 결론은 AI 도구를 사용하는 효과와 사용자가 AI 없이 수행하는 역량을 분리하는 평가가 필요하다는 것이다.

🧾 핵심 주장 / 시사점

  • AI가 낮은 초안 점수를 끌어올리는 효과와 최상위 전문성을 확대하는 효과는 구분된다. 이번 실험은 전자를 보여줬지만 최상위 점수의 빈도 증가를 보여주지는 않았다.
  • 후임의 비보조 점수가 양극화됐다는 결과는 평균만으로 학습 효과를 판단하기 어렵다는 점을 드러낸다. 좋은 점수의 증가와 매우 낮은 점수의 증가를 함께 해석해야 한다.
  • 선임의 ‘논리 감사자’ 활용은 기존 전문성이 AI 사용을 학습으로 연결할 가능성을 시사한다. 다만 3개월의 제한된 표본만으로 이 해석을 장기적인 전문성 형성의 일반 법칙으로 확정할 수는 없다.

✅ 액션 아이템

  • AI 도입 효과를 초안 작성 품질과 AI 없이 수행하는 역량으로 분리해 평가한다.
  • 경력 7년 미만 후임의 평균적 향상 부재와 매우 낮은 점수·좋은 점수의 동반 증가를 함께 검토한다.
  • 선임의 ‘논리 감사자’ 활용과 기초 전문성의 역할을 검토하되, 3개월 관찰과 제한된 표본을 고려해 장기적인 역량 축적에 대한 판단을 유보한다.

❓ 열린 질문

  • 경력 7년 미만 후임에서 매우 낮은 점수와 좋은 점수가 함께 늘어난 차이를 기존 전문성과 AI 활용 방식이 얼마나 설명할 수 있는가?
  • 선임의 ‘논리 감사자’ 활용은 후임의 AI 없이 수행하는 역량 향상에도 도움이 될 수 있는가?
  • 3개월보다 긴 기간과 더 넓은 표본에서도 AI의 초안 품질 개선과 선임·후임의 판단력 학습 차이가 유지되는가?

관련 문서

공통 태그와 주제 흐름을 기준으로 같이 보면 좋은 문서를 이어서 제안합니다.