Transformers laedt jetzt GGUF und leiht sich dafuer die Kernels von llama.cpp
Hugging Face laedt GGUF-Checkpoints ab sofort direkt in transformers. Die quantisierte Datei wird from_pretrained als gguf_file zusammen mit der Hub-Model-ID uebergeben, danach laeuft die Generierung. Die Ankuendigung traegt das Datum 22. September 2026.
Bemerkenswert ist nicht der Loader, sondern das Fundament darunter. Statt eigene quantisierte Kernels zu schreiben, greift das Team ueber die kernels-Bibliothek auf die ggml-Kernels von llama.cpp zurueck und setzt ggml-org/ggml-attn als Attention-Implementierung ein, solange die Gewichte auf Metal gepackt bleiben. Erklaertes Ziel ist Leistung nahe an llama.cpp, nicht blosse Formatakzeptanz.
Der erste Zielbereich ist eng und benannt: lokale Inferenz auf Apple Silicon, beginnend mit der Qwen3.5-Architektur. Vorausgesetzt werden transformers aus main bis zum naechsten Release, eine passende kernels-Version und ein PyTorch-Release, das die veroeffentlichten Builds der ggml-Quantisierungskernels unterstuetzen — praktisch eines der beiden juengsten.
Die Groessen sind fuer Unsloths Qwen3.5-4B dokumentiert: 8,42 GB unquantisiert als BF16, 3,53 GB bei Q6_K, 3,14 GB bei Q5_K_M, 2,74 GB bei Q4_K_M. Hugging Face empfiehlt den Einstieg bei Q4_K_M und den Schritt nach oben, wenn Speicher vorhanden ist.

Was das bedeutet
Formatkompatibilitaet ist billig anzukuendigen und teuer nutzbar zu machen, und das Team formuliert es selbst so: Kompatibilitaet nuetzt nur, wenn das Modell angenehm laeuft. Die Kernels zu leihen statt sie nachzubauen ist das Eingestaendnis, dass die Optimierungsarbeit anderswo bereits geleistet wurde.
Wer einen lokalen Inferenz-Stack betreut, steht damit nicht mehr vor der Frage nach dem Format, sondern nach der Laufzeit. Derselbe Checkpoint hat auf derselben Maschine zwei plausible Abnehmer, und die Wahl verschiebt sich zu Werkzeugen und vertrauten APIs. Die Groessentabelle ist Orientierung, kein Ergebnis: Der Qualitaetsverlust haengt von Modell und Aufgabe ab, und genau das kann eine Spalte mit Dateigroessen nicht beantworten.