Dev News Daily ENDE

Google verlagert föderiertes Lernen in attestierte Enklaven, Gboard nutzt es zuerst

Google hat die nächste Generation seines Systems für föderiertes Lernen vorgestellt, mit dem etwa die Wortvorhersage von Gboard auf Daten trainiert wird, die auf den Geräten der Nutzer bleiben. Laut einem Beitrag im Blog von Google Research vom 2. Oktober, verfasst von Katharine Daly und Daniel Ramage, verlagert das neue System die Serverseite in Trusted Execution Environments (TEEs), sodass sich seine Datenschutzgarantien von außen prüfen lassen, statt geglaubt werden zu müssen.

Was bisher fehlte. In Googles früheren föderierten Systemen wurden Geräte-Updates zur sofortigen Aggregation hochgeladen, doch niemand außerhalb von Google konnte prüfen, ob die Daten nie protokolliert oder eingesehen wurden. Secure Aggregation schützte die Uploads später kryptografisch, war laut Beitrag aber nicht mit den stärksten zentralen Garantien der differenziellen Privatsphäre vereinbar, und die Serverlogik, die das Rauschen hinzufügt, konnten weder Geräte noch Prüfer verifizieren.

Wie das neue System funktioniert. Geräte verschlüsseln Trainingsbeispiele lokal und laden sie mit einer vorab freigegebenen Zugriffsregel hoch: der Liste serverseitiger Berechnungen, die diese Daten verarbeiten dürfen und jeweils nur anonymisierte Ergebnisse ausgeben. Diese Regeln müssen in Rekor veröffentlicht werden, einem öffentlichen Transparenzlog. Ein Schlüsselverwaltungsdienst, selbst ein Verbund von TEEs mit dem Konsensprotokoll Raft, gibt Entschlüsselungsschlüssel nur an TEE-Programme heraus, die der veröffentlichten Regel entsprechen. Eine Wurzel-TEE führt eine Trainingsschleife in Python aus und verteilt parallele Arbeit an Worker-TEEs, mit Federated Language, einer quelloffenen Orchestrierungssprache aus TensorFlow Federated. Nur Kennzahlen und differenziell private Modellgewichte verlassen die Enklaven, und die verschlüsselten Uploads dürfen nur begrenzte Zeit verarbeitet werden. Die Binärdateien von Schlüsselverwaltung und Verarbeitung lassen sich reproduzierbar aus dem quelloffenen Repository Confidential Federated Compute bauen.

Platz für eigenen Code. Um Modellarchitekturen und Vorverarbeitung geheim zu halten und trotzdem prüfbar zu bleiben, können die Verarbeitungs-TEEs serialisierte Bestandteile zur Laufzeit nachladen – solange alle datenschutzrelevante Logik fest im veröffentlichten Python-Programm steht. Zu den Grenzen heutiger TEEs bei Seitenkanälen verweist der Beitrag auf sein Whitepaper.

Im Einsatz. Gboard nutzt das System bereits für englische und japanische Wortvorhersagemodelle, die laut Google stärkere Datenschutzgarantien, höhere Genauigkeit und deutlich schnellere Rechenzeiten haben als im vorherigen System.

Google verlagert föderiertes Lernen in attestierte Enklaven, Gboard nutzt es zuerst
Google verlagert föderiertes Lernen in attestierte Enklaven, Gboard nutzt es zuerst — Dev News Daily

Was das bedeutet

Der Wechsel geht von „vertraut unserem Server“ zu „prüft unseren Server“. Remote-Attestierung und ein öffentliches Log der erlaubten Berechnungen geben Prüfern etwas Konkretes in die Hand. Die Garantie ist allerdings nur so stark wie die TEE-Hardware und die Prüfer, die die veröffentlichten Regeln tatsächlich lesen – deshalb zählen die reproduzierbaren Builds so viel wie die Enklaven.