Toward provably private learning from federated data
Quick Summary
Google Research는 신뢰 실행 환경(TEE)을 활용해 개인정보 보호를 외부에서 검증할 수 있도록 하고, 연산을 서버로 옮겨 학습 속도·정확도·기기 포괄 범위를 개선하는 차세대 연합학습(FL) 시스템을 발표했다.
🖼️ 인포그래픽

🖼️ 4컷 인포그래픽

💡 한 줄 요약
Google Research는 신뢰 실행 환경(TEE)을 활용해 개인정보 보호를 외부에서 검증할 수 있도록 하고, 연산을 서버로 옮겨 학습 속도·정확도·기기 포괄 범위를 개선하는 차세대 연합학습(FL) 시스템을 발표했다.
📌 핵심 요약
- Google은 2017년 연합학습(FL)을 도입했으며, 데이터 최소화, 데이터 익명화, 투명성과 통제, 검증 가능성과 감사 가능성이라는 네 가지 개인정보 보호 원칙을 바탕으로 발전시켜 왔다. 새 시스템은 TEE를 활용해 종단 간 익명화 보장을 외부에서 검증하고 감사할 수 있도록 설계됐다.
- 기기는 학습 데이터를 암호화해 업로드하고, 데이터에 접근할 수 있는 TEE 연산을 접근 정책으로 사전 승인한다. 접근 정책은 공개 투명성 로그 Rekor에 게시되며, KMS는 정책에 부합하는 TEE 작업에만 복호화 키를 제공한다. 운영자에게는 지표와 차등 개인정보 보호(DP)가 적용된 모델 가중치만 공개된다.
- Gboard는 새 시스템을 영어와 일본어 다음 단어 예측 모델에 적용했으며, 개인정보 보호 보장과 정확도가 개선됐다고 보고했다. 영어 모델을 5000라운드 동안 기기 6500대씩의 코호트로 학습한 비교에서는 참여 일정 최적화를 통해 더 강한 개인정보 보호 보장 또는 더 작은 노이즈 배수가 가능해지는 양상을 제시했다.
- 기존 FL 모델 학습은 기기 가용성, 기기 내 연산, 여러 작업의 기기 자원 경쟁 때문에 모델당 1~2개월이 걸릴 수 있었다. 새 시스템은 업로드를 먼저 수집하고 클라이언트 그래디언트 연산을 서버로 옮겨 여러 머신에서 병렬 처리하며, 현재 학습 속도는 TEE 자원 가용성의 제약을 받는다.
- 시스템은 Python으로 표현할 수 있는 임의의 작업도 검증 가능한 방식으로 실행할 수 있으며, 합성 데이터 생성과 LLM 추론용 TEE와의 결합을 탐색 중이다. 다만 현재 세대 TEE의 한계와 사이드 채널 관측 문제가 남아 있고, DP 알고리즘과 시스템 구성요소의 소프트웨어 구현에 대한 완전한 정확성 증명은 미래의 가능성으로 제시됐다.
🧩 주요 포인트
- 사전 승인된 접근 정책·Rekor·KMS의 결합 → 서버의 데이터 접근과 익명화 처리를 외부 검증 대상으로 만들어 서버 운영자에 대한 신뢰 의존을 줄인다.
- 업로드 수집과 서버 학습의 분리 → 기기 가용성의 일중 변동 영향을 줄이고 참여 일정과 DP 매개변수를 함께 조정해 개인정보 보호와 모델 효용의 관계를 개선한다.
- 클라이언트 그래디언트의 서버 연산과 병렬 처리 → 기기 내 연산 제약을 완화하고 더 큰 모델의 학습 가능성을 넓히지만, TEE 자원 가용성과 현재 하드웨어의 보호 한계가 주요 제약으로 남는다.
🧠 상세 정리
1. 연합학습의 발전과 개인정보 보호 원칙
2026년 10월 2일 Google Research의 Katharine Daly와 Daniel Ramage는 외부에서 개인정보 보호 보장을 검증할 수 있는 차세대 연합학습 시스템을 발표했다. Google이 2017년 도입한 연합학습은 분산된 비공개 데이터를 바탕으로 모델을 학습하는 방식이며, Gboard의 다음 단어 예측과 Smart Compose, Google Messages의 답장 제안, Android의 Smart Text Selection 등에 활용됐다. 시스템 개발은 데이터 최소화, 데이터 익명화, 투명성과 통제, 검증 가능성과 감사 가능성이라는 네 원칙을 따른다. 익명화 연구는 행렬 분해 기반 DP-FTRL인 MF-DP-FTRL과 Secure Aggregation을 결합한 분산 차등 개인정보 보호 등을 통해 실제 운영 모델의 강한 DP 보장으로 이어졌다. 2025년에 제시한 FL 정의는 서비스 제공자의 조정 아래 여러 클라이언트가 협력하되, 클라이언트가 자신의 데이터와 접근 가능한 작업, 해당 작업의 익명화 속성을 통제하고 사용자에게 적절한 투명성과 통제권을 제공해야 한다는 점을 강조했다.
2. 개별 TEE에서 종단 간 검증 가능한 시스템으로
새 시스템은 신뢰 실행 환경인 TEE의 특성을 이용해 데이터 익명화 보장을 검증하고 감사할 수 있도록 설계됐다. TEE에서 실행되는 로직은 원격 증명을 통해 제삼자가 확인할 수 있으며, 내부 상태를 관측할 수 없도록 하는 기밀성과 실행 로직이 방해받지 않도록 하는 무결성을 제공하지만 이러한 특성은 현재 세대 TEE의 한계를 전제로 한다. Google은 단일 머신 수준에서 제공되는 이 특성들을 연결해 종단 간 검증 가능한 FL 시스템을 구성하고, 더 강한 개인정보 보호와 개선된 정확도를 달성했다고 설명한다. 설계는 앞선 confidential federated analytics와 provably private insights 연구에서 개발한 기법을 기반으로 한다. 기존 시스템에서는 즉시 집계하기 위해 업로드된 데이터가 기록되거나 열람되지 않았는지 외부에서 검증할 수 없었고, 이후 도입한 Secure Aggregation은 업로드를 암호학적으로 보호했지만 최신 중앙 DP 보장과는 호환되지 않았다는 것이 원문의 문제 제기다.
3. 암호화 업로드와 접근 정책에 따른 키 제공
클라이언트 기기는 학습 예제를 로컬에서 암호화한 뒤 업로드하며, 어떤 TEE 연산이 데이터를 처리할 수 있는지 접근 정책으로 사전 승인한다. 승인된 연산은 익명화된 결과만 내보내도록 제한되고, 클라이언트는 해당 접근 정책이 공개 투명성 로그에 게시되도록 요구한다. 키 관리 시스템인 KMS는 RAFT 합의 프로토콜을 구현한 TEE 클러스터로 구성되며, 서버 작업이 접근 정책에 명시된 연산과 일치할 때만 복호화 키를 제공한다. 따라서 암호화된 학습 데이터는 정책에 표현된 Python 학습 프로그램을 실행하는 TEE 내부에서만 복호화되고 처리될 수 있으며, 업로드 후 접근 가능한 시간도 제한된다. 원문에 따르면 작업 운영자가 볼 수 있는 것은 지표와 DP가 적용된 모델 가중치뿐이며, 이 구조는 데이터에 접근할 수 있는 작업의 범위를 기기가 미리 알고 승인하도록 만드는 핵심 장치다.
4. Python 학습 실행과 장애 복구
데이터 처리 TEE는 학습 루프를 구현한 Python 프로그램을 실행하며, 중심 역할을 맡는 루트 TEE는 병렬화할 수 있는 하위 작업을 여러 워커 TEE에 위임한다. 분산 실행 로직은 이전 FL 시스템에 쓰였던 TensorFlow Federated에서 파생된 Federated Language로 표현되며, 이는 특정 프레임워크에 종속되지 않는 오픈소스 오케스트레이션 언어다. 학습 루프는 주기적으로 익명화된 모델 가중치를 데이터 분석자에게 내보내도록 구성된다. Python 프로그램은 학습 라운드가 끝날 때 KMS로 암호화한 복구 상태를 저장하고, 이를 사용해 루트 또는 워커에서 간헐적으로 발생하는 장애 이후 실행을 복구할 수 있다. 이 복구 방식은 추가적인 개인정보 민감 정보를 누출하지 않도록 설계됐으며, 원문은 실행과 병렬 처리뿐 아니라 장애 대응도 개인정보 보호를 유지하는 시스템의 운영 개념으로 함께 제시한다.
5. 공개 감사와 독점 로직 보호의 양립
기기가 승인하는 접근 정책은 공개 투명성 로그 Rekor에 게시되므로 외부 감사자는 기기 데이터에 접근할 가능성이 있는 서버 작업 전체를 추적할 수 있다. KMS와 데이터 처리 바이너리는 Confidential Federated Compute Github 저장소에 공개된 오픈소스 코드로부터 재현 가능하게 빌드할 수 있다. 이전 FL 시스템에서는 서버 로직을 기기나 감사자가 검증할 수 없어 그래디언트 합에 무작위 노이즈가 올바르게 추가된다는 점을 운영자에게 신뢰해야 했지만, 새 접근 정책은 FL 학습 로직을 표현하는 Python 프로그램을 직접 설명한다. 독점적인 모델 구조와 데이터 전처리 로직을 보호하기 위해 데이터 처리 TEE는 실행 중 직렬화된 정보를 Python 프로그램에 사이드로딩하는 기능도 지원한다. 다만 강한 외부 검증 가능성을 유지하려면 개인정보 보호와 관련된 모든 로직이 Python 프로그램에 고정돼 있어야 하며, 동적으로 불러오는 작업의 보호에는 사이드 채널 관측과 관련된 한계도 고려해야 한다.
6. Gboard 적용과 개인정보 보호·효용의 개선
Gboard는 TEE 기반 FL 시스템을 배포해 영어와 일본어 다음 단어 예측 모델을 출시했으며, 원문은 두 모델이 더 강한 개인정보 보호 보장과 개선된 정확도를 얻었다고 설명한다. 개선 요인 중 하나는 서버 학습 작업을 실행하기 전에 기기 업로드를 모두 수집해, 기기 가용성의 일중 변동이 학습 진행에 영향을 주는 문제를 줄인 것이다. 서버에서 프로그램을 실행할 때 최적의 기기 참여 일정을 동적으로 계산하고, 이를 활용해 다른 DP 매개변수도 조정할 수 있다. 원문이 제시한 비교 곡선은 이전 시스템과 새 시스템에서 영어 다음 단어 예측 모델을 각각 5000라운드 동안 기기 6500대씩의 코호트로 학습한 결과에서 도출됐다. 이 비교는 참여 일정 최적화로 더 강한 개인정보 보호 보장 또는 더 작은 노이즈 배수가 가능함을 보여주지만, 본문에는 정확도 향상 폭이나 곡선의 구체적인 수치가 제시되지 않았다.
7. 서버 연산으로 이동한 병목과 작업 확장
기존 FL 모델은 기기 가용성과 기기 내 연산 성능, 동일한 기기 자원을 사용하는 여러 학습 작업 간 경쟁 때문에 모델 하나를 학습하는 데 1~2개월이 걸릴 수 있었다. 새 시스템은 병목을 서버로 옮기고 여러 머신에서 연산을 병렬화해 학습 시간을 크게 단축했으며, 현재는 TEE 자원의 가용성이 속도를 제한한다고 설명한다. 클라이언트 그래디언트 계산도 서버로 이동하므로 이전 시스템의 기기 내 연산 자원 제약이 완화되고, 더 큰 모델을 FL 기법으로 학습할 가능성이 열린다. 원문은 이러한 활용에서 TEE와 가속기의 통합이 중요한 역할을 할 것이라고 전망한다. 또한 시스템은 FL 학습뿐 아니라 Python으로 표현되는 임의의 작업을 검증 가능한 방식으로 실행할 수 있어, 합성 데이터 생성과 임의의 Python을 실행하는 데이터 처리 TEE를 LLM 추론 등 특정 기능에 특화된 다른 TEE와 결합하는 방안을 탐색하고 있다.
8. 현재의 보장과 완전한 증명을 향한 과제
저자들은 이번 작업을 서버 측 처리가 개인의 개인정보를 보존한다는 엄밀한 증명을 향한 한 단계로 평가한다. 외부 검증자가 Google에서 실제 실행하는 코드를 확인할 수 있게 함으로써, 서버의 데이터 처리가 설명된 방식대로 수행된다는 강한 보장을 제공한다는 주장이다. 그러나 TEE가 제공하는 기밀성과 무결성은 현재 하드웨어의 한계를 전제로 하며, 동적으로 불러오는 작업을 악의적인 서버 측 공격으로부터 더 깊이 보호하려면 추가 발전이 필요하다. 원문은 미래의 TEE 하드웨어와 사이드 채널 관측을 완화하는 지속적인 연구가 이러한 보호를 강화할 것으로 기대한다. DP 알고리즘과 시스템 구성요소의 소프트웨어 구현에 대한 완전한 정확성 증명도 장래에 가능할 것으로 전망하므로, 현재의 외부 검증 가능한 처리 보장과 앞으로 기대하는 완전한 소프트웨어 증명을 구분해 이해해야 한다.
🧾 핵심 주장 / 시사점
- 새 FL 시스템에서 개인정보 보호의 핵심 변화는 서버 연산 자체를 피하는 데서 벗어나, 승인된 코드만 데이터를 처리하고 익명화 결과만 공개한다는 점을 외부에서 검증하도록 만드는 데 있다.
- 업로드와 학습 실행을 분리하면 기기 참여 일정을 서버에서 최적화할 수 있으므로, 시스템 운영 방식의 변화가 학습 속도뿐 아니라 DP 보장과 모델 효용에도 영향을 준다.
- 외부 감사 가능성과 독점 로직 보호를 함께 추구하는 설계에서는 개인정보 보호 관련 로직을 공개적으로 검증 가능한 프로그램에 고정하는 조건이 중요하며, TEE의 현재 한계와 미래의 완전한 정확성 증명은 구분해야 한다.
✅ 액션 아이템
- 접근 정책·Rekor·KMS가 데이터 접근과 익명화 처리의 외부 검증을 어떻게 연결하는지 검토한다.
- Gboard의 영어 모델을 5000라운드, 기기 6500대씩의 코호트로 비교한 결과에서 참여 일정 최적화와 DP 보장의 관계를 검토한다.
- 서버 연산을 통한 학습 확장 가능성을 TEE 자원 가용성, 현재 세대 TEE의 한계, 사이드 채널 관측 문제와 함께 평가한다.
❓ 열린 질문
- Gboard의 영어와 일본어 다음 단어 예측 모델에서 정확도와 학습 시간이 각각 얼마나 개선됐는가?
- 5000라운드와 기기 6500대씩의 코호트 비교에서 참여 일정 최적화는 DP 보장과 노이즈 배수를 구체적으로 얼마나 개선했는가?
- 현재 세대 TEE의 한계와 사이드 채널 관측 문제를 고려할 때, DP 알고리즘과 시스템 구성요소의 완전한 정확성 증명까지 어떤 과제가 남아 있는가?