Ne oldu?
Google Research, Güvenilir Yürütme Ortamları (TEE) üzerine kurulu yeni nesil bir federe öğrenme (FL) sistemi duyurdu. Şirket, federe öğrenme için ilk kez dışarıdan doğrulanabilir merkezi diferansiyel gizlilik (DP) garantisi sağladığını söylüyor. Sistem, Gboard'da İngilizce ve Japonca sonraki kelime tahmini modellerini eğitmek için kullanıldı.
Hangi sorunu çözüyor?
Google federe öğrenmeyi 2017'de tanıttı; bu yöntem Gboard'da sonraki kelime tahmini ve Smart Compose, Google Messages'ta yanıt önerileri ve Android'de Smart Text Selection gibi özellikleri besliyor. Ancak eski sistemlerde bir güven boşluğu vardı: cihazlar veriyi yüklese de dışarıdan kimse bu verinin hiç kaydedilmediğini veya incelenmediğini doğrulayamıyordu. Güvenli Toplama kriptografik koruma ekledi ama matris ayrıştırmalı DP-FTRL gibi güncel merkezi DP algoritmalarıyla uyumlu değildi. Ayrıca DP gürültüsünün doğru eklenmesi için Google'a güvenmek gerekiyordu.
Sistem nasıl çalışıyor?
Yeni tasarım, istemci gradyan hesaplamasını sunucuya taşıyor ve bu sunucu mantığını doğrulanabilir (attestable) hale getiriyor; böylece operatöre güvenmek gerekmiyor. Sistem dört bileşenden oluşuyor:
- Veri yükleme: Cihazlar eğitim örneklerini yerel olarak şifreler ve hangi TEE hesaplamalarının veriyi işleyebileceğini belirten bir erişim politikası tanımlar. Politikalar herkese açık bir şeffaflık kaydında yer almalı.
- KMS ve politika doğrulama: TEE'ler üzerinde RAFT konsensüs protokolüyle çalışan Anahtar Yönetim Sistemi, anahtarları yalnızca politikaya uyan iş yüklerine verir.
- İş yükü yürütme: Bir kök TEE, Python eğitim döngüsünü çalıştırır ve alt görevleri işçi TEE'lere devreder. Yalnızca DP'li model ağırlıkları dışarı verilir.
- Hata toleranslı kurtarma: Her turda, kök veya işçi arızalarına karşı KMS ile şifrelenmiş bir kurtarma durumu kaydedilir.
Gizlilik garantisi neden doğrulanabilir?
Erişim politikaları, Sigstore'un herkese açık şeffaflık kaydı Rekor'a yayımlanıyor. Dış denetçiler, bir cihazın veri verebileceği her sunucu iş yükünü takip edebiliyor. KMS ve veri işleme ikili dosyaları açık kaynak koddan yeniden üretilebilir şekilde derlenebiliyor. Tescilli model mimarilerini korumak için TEE'ler çalışma anında serileştirilmiş mantık yüklemeyi (sideloading) destekliyor; ancak gizlilikle ilgili tüm mantık doğrulanan programda sabit kodlu kalmalı.
Gboard'a ne kazandırdı?
Gboard, bu sistemi İngilizce ve Japonca sonraki kelime tahmini modellerini daha güçlü gizlilik garantileri ve daha iyi doğrulukla başlatmak için kullandı. İki tasarım tercihi öne çıkıyor: Tüm yüklemeler sunucu tarafı eğitim başlamadan önce toplanıyor, böylece cihaz kullanılabilirliğindeki günlük dalgalanmalar eğitimi yavaşlatmıyor. Ayrıca darboğaz sunucuya taşındı; önceki FL modellerinin eğitimi 1-2 ay sürerken artık eğitim makineler arasında paralelleşiyor ve yalnızca TEE kaynak kullanılabilirliğiyle sınırlı. Google belirgin şekilde daha hızlı hesaplama süreleri bildiriyor ancak tek bir hızlanma rakamı paylaşmıyor.