Datengewichte extrapolieren schlecht: der Effekt kehrt sich mit der Größe um
Alex Renda und Nitya Mani von Jane Street haben eine Untersuchung zur Datengewichtung über hauseigene und offene Sprachmodelle veröffentlicht: https://blog.janestreet.com/a-study-of-sequence-weighting-at-scale/. Sie variieren das Gewicht, das eine Sequenz im Trainingsverlust trägt, und messen, wie stark die Verlustverringerung für diese Sequenz davon abhängt.
Das Ergebnis ist nicht monoton über die Skalen, und die Gestalt lohnt die genaue Formulierung:
- bei kleinen Modellen werden allgemeine Muster weitgehend unabhängig vom Gewicht gelernt;
- bei mittleren Modellen werden datenspezifische Muster ungefähr proportional zum Gewicht gelernt;
- bei großen Modellen wird alles gelernt, was in den Daten steckt, und die Abhängigkeit vom Gewicht verschwindet wieder.
Das ist deshalb erheblich, weil diese Entscheidungen in der Praxis anders fallen. Eine dichte Rastersuche über die Hyperparameter der Datenmischung ist bei mittleren Größen untragbar und bei den größten unmöglich — dort trainiert man für eine Aufgabe vielleicht genau ein Modell. Der übliche Ausweg ist ein Skalierungsgesetz: den Hyperparameter billig im Kleinen anpassen und extrapolieren, der Chinchilla-Zug.
Extrapolation trägt nur, wenn das Verhalten entweder über die Skalen stabil oder vorhersagbar veränderlich ist. Verhalten, das beides nicht erfüllt, nennen die Autoren aberrant — und berichten, dass Datenmischung dafür besonders anfällig ist. Sie verweisen auf eine Parallele im Technikbericht zu MAI-Thinking-1 (Abschnitt 2.5.2), wo sich die Rangfolge zwischen einer code- und einer MINT-lastigen Mischung mit wachsender Modellgröße umkehrte.
Methodisch untersuchen sie Gewichtung statt Mischung, um eine Variable zu isolieren: Mischungsexperimente vermengen das Gewicht einer Quelle mit ihrer Qualität und damit, wie viel neue Information ihre marginalen Token tragen. Gewichte je Sequenz entfernen beides.

Was das bedeutet
Ein im Kleinen abgestimmter Hyperparameter ist eine Hypothese, keine Messung. Die gängige Praxis, Mischungsgewichte an kleinen Läufen anzupassen, setzt eine glatte Kurve voraus. Hier heißt es: Gerade bei Datenmischung kann die Kurve umkehren — das Ergebnis im Kleinen ist dann nicht bloß ungenau, sondern verkehrt herum.
„Das große Modell lernt es ohnehin" ist die praktische Folgerung fürs Höhergewichten. Wenn ein großes Modell Muster unabhängig von ihrem Gewicht aufnimmt, bringt Aufwand für das Hochgewichten eines Lieblingskorpus weniger als erwartet — und der eigentlich gewünschte Hebel war vermutlich Filtern oder Entduplizieren: Das verändert, was vorhanden ist, statt wie laut es wiederholt wird.
Und die ehrliche Lesart ist eine Warnung an die eigene Auswertung. Zwei Teams können dasselbe Mischungsexperiment auf verschiedenen Skalen fahren und zu entgegengesetzten Schlüssen kommen — beide korrekt. Bevor ein Mischungsverhältnis als geklärt zitiert wird, lautet die Frage: auf welcher Skala wurde es festgestellt, und hat jemand geprüft, ob die Rangfolge die nächste Größenordnung übersteht?