Hugging Face startet offenes TTS-Leaderboard mit Messwerten statt Abstimmungen
Hugging Face hat das Open TTS Leaderboard gestartet, eine Rangliste für Text-to-Speech-Modelle, die auf objektiven Messwerten statt auf Hörerstimmen beruht. Grund ist die Menge: Auf dem Hub liegen inzwischen mehr als 8.000 TTS-Modelle, und Arena-Ranglisten, die nach menschlicher Präferenz sortieren, kommen nicht hinterher.
Die Autoren argumentieren zudem, dass offene Modelle in Arenen unterrepräsentiert sind. Stand 30. September zählen sie bei Artificial Analysis 16 Modelle mit offenen Gewichten unter 92, bei Voice Arena sei das Verhältnis ähnlich. Ihre Erklärung ist praktisch: Ein API-Modell braucht kaum mehr als einen Schlüssel, ein offenes Modell muss der Arena-Betreiber selbst hosten. Außerdem könne keine Arena sicherstellen, dass Abstimmende über die Zeit denselben Maßstab für „besser“ anlegen.
Das neue Leaderboard misst drei Dinge. Verständlichkeit ist die Wort- oder Zeichenfehlerrate zwischen Prompt und Transkript des erzeugten Audios, erstellt mit Qwen3 ASR. Tempo ist der inverse Echtzeitfaktor bei Batch-Inferenz auf einer H200-GPU, dazu die Zeit bis zum ersten Audio bei Batchgröße eins auf GPU und CPU. Beim Stimmklonen ist die Sprecherähnlichkeit die Kosinusähnlichkeit zwischen WavLM-Sprecher-Embeddings von Ausgabe und Referenzclip. Die Bewertung eines Modells dauert so ein paar Stunden statt der Wochen, die das Sammeln von Stimmen braucht.
Die Standardansicht sortiert nach der durchschnittlichen Fehlerrate auf den englischen Teilen von Seed TTS Eval und CV3 Eval. Dort führen hexgrad/Kokoro-82M, Supertone/supertonic-3 und fishaudio/s2-pro. Weitere Sprachen lassen sich zuschalten; als starke mehrsprachige Modelle nennt der Beitrag k2-fsa/OmniVoice, fishaudio/s2-pro und FunAudioLLM/Fun-CosyVoice3-0.5B-2512.
Die Grenzen benennen die Autoren ausdrücklich. Die Messwerte sind Näherungen: Keiner misst Natürlichkeit, Ausdruck oder Hörerpräferenz, und das Leaderboard soll menschliche Rankings ergänzen, nicht ersetzen.

Warum das wichtig ist
Ein Modell, das eine Arena anführt, wurde womöglich nie in der Sprache getestet, die man ausliefert. Eine reproduzierbare Fehlerrate pro Sprache ist ein günstigerer erster Filter – solange niemand „wenigste Transkriptionsfehler“ mit „klingt am besten“ verwechselt.