Ai2 ersetzt GPU-Prioritäten durch Budgets: 98 % der Stunden geliefert
Das Allen Institute for AI (Ai2) hat am 9. Oktober beschrieben, wie es den Scheduler seiner Trainingscluster umgebaut hat — Tausende NVIDIA H100, B200 und B300 in Clustern von 88 bis 1.024 GPUs, geteilt von rund 150 Forschern, bei einer Nachfrage von zwei- bis dreimal der verfügbaren Kapazität.
Was nicht funktionierte. Das alte System war prioritätsbasiert, Teams durften Jobs bis zu einer Grenze gleichzeitiger GPUs als nicht unterbrechbar markieren. Ai2 beschreibt die vorhersehbaren Folgen: „Squatting“ (GPUs leer halten, um sie nicht zu verlieren), Prioritätsinflation, weil „hoch“ nichts kostete, und Reparaturversuche über feste GPU-Monopole für wichtige Projekte — die GPUs immer dann leer stehen ließen, wenn ein Team zwischen Experimenten war. Das Team nennt es eine selbst gebaute Tragik der Allmende.
Was es ersetzt. Drei Bausteine:
- Budgets statt Zeitpläne. Manager verteilen einen Anteil an GPU-Zeit, nicht GPUs, entlang eines Projektbaums — ein Blattprojekt hat etwa einen garantierten Anspruch auf 35 % der Kapazität. Jede nicht budgetierte Anfrage ist unterbrechbar; Squatting verbraucht damit das eigene Budget.
- Hierarchisches Fair-Share über ein 7-Tage-Fenster — dieselbe Linie wie der Hadoop Fair Scheduler (2009), SLURMs Fair Tree und YARN. Unterversorgte Budgets rücken vor überversorgte; Arbeit über das Budget hinaus darf ungeschützt auf freien GPUs laufen.
- Ein Scheduling-Vertrag. Jeder Job nennt eine Mindestlaufzeit — die kürzeste Belegung mit echtem Fortschritt — und ob er fortsetzbar ist. In diesem Fenster ist er geschützt, danach kann er unterbrochen und neu eingereiht werden. Erst das macht aus Fair-Share Zeitscheiben für Jobs, die sonst tagelang laufen.

Ergebnisse aus 30 Testtagen nach schrittweiser Einführung ab Ende Juli. Teams erhielten 98 % der ihnen zustehenden GPU-Stunden; 13 von 15 Budgets bekamen 95 % oder mehr, das schlechteste 90 %. Die p90-Wartezeit von Debug-Jobs fiel von 2 Stunden auf 30 Sekunden (ein Simulator hatte 6 Stunden auf 5 Minuten vorhergesagt). Weil defekte Hosts jetzt automatisch geleert werden, sobald Jobs ihre Mindestlaufzeit erreichen, sanken Reparaturen mit menschlichem Eingriff um 74 %.
Was nicht besser wurde. Interaktive Sitzungen, die früher eine Woche liefen, sind jetzt nur 8 Stunden geschützt. Ai2 beobachtet mögliche Kapazitätsfragmentierung, die Wartezeiten der größten Jobs verlängern könnte, und schreibt, Dokumentation allein habe die neuen Regeln nicht erklärt — Live-Erklärungen und Nutzungsgrafiken je Team schon.
Warum das über Ai2 hinaus zählt. Die meisten Organisationen mit geteiltem GPU-Pool betreiben eine Variante des alten Systems. Die nützliche Lehre ist die Reihenfolge: Strategie vorab als Budget festlegen, einen bewährten Fair-Share-Algorithmus durchsetzen lassen und Unterbrechung zu einem Vertrag machen, den Nutzer eingehen, statt zu einer Strafe.
Quelle: Ai2 im Hugging-Face-Blog, „Impactful scheduling for GPU clusters“, 9. Oktober 2026 — https://huggingface.co/blog/allenai/impactful-scheduling