Dev News Daily ENDE

GKE-Pod-Snapshots stellen ein geladenes 70B-Modell in 37 Sekunden wieder her

Google hat für die Google Kubernetes Engine Pod-Snapshots eingeführt: eine Funktion, die den laufenden Zustand einer Anwendung - einschließlich CPU- und GPU-Speicher - sichert und bei Bedarf wiederherstellt. In der Ankündigung schreibt Google, der Ansatz verkürze den Start von KI-Inferenz um bis zu 89 Prozent; in den eigenen Benchmarks lud ein Modell mit 70 Milliarden Parametern in 37 Sekunden, eines mit 8 Milliarden in 15 Sekunden. InfoQ berichtete am 27. September, die Funktion sei allgemein verfügbar.

Ziel ist der Kaltstart. Ein neues Inferenz-Replikat muss normalerweise seinen Server starten, Modellgewichte herunterladen und in den Beschleunigerspeicher laden - bei großen Modellen dauert das Minuten und verleitet Betreiber dazu, Reservekapazität laufen zu lassen. Mit Pod-Snapshots geschieht diese Initialisierung einmal; GKE erfasst den vollständig geladenen Zustand, legt ihn in Cloud Storage ab, und neue Replikate starten direkt daraus. Derselbe Mechanismus ist für Agenten-Sandboxes gedacht: eine vorbereitete Sandbox einmal erfassen und neue daraus starten, oder eine ungenutzte Sandbox anhalten und bei Bedarf fortsetzen. Konfiguriert werden Snapshots deklarativ über Custom Resources, die festlegen, welche Pods gesichert werden und wo die Daten liegen; sie lassen sich beim Start oder auf Anforderung auslösen und haben Aufbewahrungsregeln.

Google zitiert einen Kunden, die Fotobearbeitungsplattform Retake von Codeway, die eine eigene Caching-Schicht ersetzt und die Startzeit auf H100-GPUs von etwa einer Minute auf 8 Sekunden gesenkt haben will.

GKE-Pod-Snapshots stellen ein geladenes 70B-Modell in 37 Sekunden wieder her
GKE-Pod-Snapshots stellen ein geladenes 70B-Modell in 37 Sekunden wieder her — Dev News Daily

Was das bedeutet

Einen ganzen Prozess zu sichern und wiederherzustellen, ist eine alte Idee; sie auf GPU-Speicher in einem verwalteten Kubernetes-Dienst anzuwenden, macht sie für Inferenz praktikabel. Die Rechnung ist einfach: Ist ein Replikat in Sekunden statt Minuten bereit, kann Autoscaling der Nachfrage folgen, statt sie vorwegzunehmen, und weniger teure Beschleunigerkapazität steht ungenutzt herum.

Die Vorbehalte sind die jedes Snapshots. Ein Snapshot hält einen Zeitpunkt fest; alles, was frisch sein muss - Zugangsdaten, Verbindungen, anfragebezogene Daten -, muss beim Wiederherstellen behandelt werden, und viele Replikate aus einem Abbild starten identisch. Die Benchmark-Zahlen stammen von Google selbst und hängen von Modellgröße, Hardware und Speicherdurchsatz ab. Und die Funktion ist GKE-spezifisch: Wer Portabilität zwischen Clouds will, übernimmt eine Plattformfunktion, keinen Kubernetes-Standard.

Geschrieben von Victoria Shinder.