Dev News Daily ENDE

DeepSeek beschreibt die Sandbox-Plattform hinter seinem Agententraining

DeepSeek hat einen technischen Bericht über DeepSeek Elastic Compute veröffentlicht, kurz DSec - die Sandbox-Plattform, mit der das Unternehmen KI-Agenten trainiert und bewertet. Das Papier, auf arXiv als 2609.22978 erschienen und mit weit über hundert Autoren, geht von einer praktischen Beobachtung aus: Agententraining braucht isolierte Umgebungen mit Zustand, in denen ein Modell Repositories untersucht, Werkzeuge aufruft, Befehle ausführt und mit aufgabenspezifischen Diensten spricht. Diese Umgebungen entstehen in großen Schüben, brauchen unterschiedliche Isolation, behalten über lange Interaktionen ihren Zustand und stammen aus großen Image-Sammlungen mit wenig Wiederverwendung. Nach Ansicht der Autoren verlangt das eine elastische Plattform statt einer einzelnen Sandbox-Laufzeit.

DSec bietet vier Arten von Sandboxes hinter einem SDK an - Funktionsaufrufe, Container, MicroVMs und vollständige VMs - und steuert Platzierung und Lebenszyklus im Cluster. Umgebungen werden aus unabhängig versionierten Schichten zusammengesetzt, Speicher wird geteilt und zurückgewonnen, um Sandboxes dicht zu packen, und Image-Daten werden bei Bedarf aus 3FS geladen, DeepSeeks verteiltem Dateisystem. Die Plattform ist gemeinsam mit dem Framework für bestärkendes Lernen entworfen: Rollouts mit Zustand laufen getrennt vom unterbrechbaren GPU-Training, Lebenszyklen der Sandboxes werden mit dem Training abgestimmt, damit der Rollout-Zustand erhalten bleibt, während ungenutzte Ressourcen zurückgeholt werden, und das System enthält Maßnahmen gegen Fehlverhalten von Agenten wie Reward Hacking.

Die Größenordnungen sind die Schlagzeile. Laut Bericht umfasst eine Produktionseinheit rund 160 Knoten und bedient etwa 3 Millionen Sandboxes am Tag; im Betrieb trägt DSec mehr als 380.000 gleichzeitige Sandboxes und über 5.000 neue Sandboxes pro Sekunde. Das Papier ist eine erweiterte Fassung einer Kurzfassung, die im Track für Betriebssysteme der ACM SIGOPS ATC begutachtet wurde.

DeepSeek beschreibt die Sandbox-Plattform hinter seinem Agententraining
DeepSeek beschreibt die Sandbox-Plattform hinter seinem Agententraining — Dev News Daily

Was das bedeutet

Öffentlich wird beim Training von KI-Agenten meist über Modelle und Belohnungsdesign gesprochen. Der Bericht erinnert daran, dass die Umgebung, in der der Agent handelt, selbst ein großes verteiltes System ist, dessen Durchsatz und Isolation bestimmen, was sich trainieren lässt. Fünftausend Umgebungen pro Sekunde, jede isoliert und mit Zustand, sind ein Planungs- und Speicherproblem, bevor sie ein Problem des maschinellen Lernens sind.

Für Entwickler von Agentenprodukten lassen sich zwei Entscheidungen verallgemeinern. Mehrere Isolationsstufen hinter einer Schnittstelle erlauben, billige Aufgaben in leichten Sandboxes und riskante in vollständigen VMs laufen zu lassen, ohne den aufrufenden Code zu ändern. Und Reward Hacking als etwas zu behandeln, das die Infrastruktur eindämmen muss, statt nur als Eigenschaft der Belohnung, erkennt an, dass ein Agent mit Shell die Abkürzungen findet, die seine Umgebung zulässt. Die Zahlen stammen von DeepSeek selbst und beschreiben dessen Produktionssystem; ein unabhängiger Vergleich sind sie nicht.

Primärquelle
arXiv - DeepSeek Elastic Compute (DSec)
https://arxiv.org/abs/2609.22978
Geschrieben von Victoria Shinder.