Das Open TTS Leaderboard soll die Bewertung von Text-to-Speech-Modellen vereinheitlichen. Auf dem Hugging Face Hub waren am 30. September 2026 mehr als 8.000 TTS-Modelle verfügbar. Menschliche Vergleichstests können laut Hugging Face nicht mit diesem Veröffentlichungstempo Schritt halten: Bei solchen Tests hören Nutzer Ausgaben zweier Modelle und stimmen für die bevorzugte Variante. Die Rangfolge ergibt sich aus den gesammelten Stimmen und einem Elo-Wert.
Das neue Angebot ergänzt solche Tests mit drei messbaren Kriterien. Für die Verständlichkeit werden Wort- und Zeichenfehlerraten der erzeugten Sprache ermittelt; dafür transkribiert Qwen3 ASR die Audiodateien. Die Geschwindigkeit erfasst das Leaderboard sowohl bei gebündelter Offline-Verarbeitung als auch über die Zeit bis zum ersten Audio bei Streaming. Beide Messungen erfolgen auf einer H200-GPU; die Streaming-Latenz wird zusätzlich auf einer CPU erfasst. Für Stimmähnlichkeit vergleicht das System Sprecher-Einbettungen aus der generierten Aufnahme und einer Referenz.
Die Standardansicht sortiert Modelle nach ihrem durchschnittlichen WER in englischen Tests von Seed TTS Eval und CV3 Eval. In diesem Vergleich liegen hexgrad/Kokoro-82M, Supertone/supertonic-3 und fishaudio/s2-pro vorne. Für mehrsprachige Tests nennt Hugging Face k2-fsa/OmniVoice, fishaudio/s2-pro und FunAudioLLM/Fun-CosyVoice3-0.5B-2512 als starke Modelle. Bei Chinesisch, Japanisch und Koreanisch wird statt der Wortfehlerrate die Zeichenfehlerrate ausgewiesen. Eine gesonderte Ansicht vergleicht Modelle mit Voice-Cloning-Funktion und ergänzt die Kennzahl zur Stimmähnlichkeit. Bei bosonai/higgs-tts-3-4b und openbmb/VoxCPM2 verbessert sich der durchschnittliche WER laut Hugging Face, wenn eine Referenzaufnahme verwendet wird.
Die Rangliste ersetzt nach Angaben von Hugging Face keine Bewertung durch Menschen: Die automatischen Werte erfassen weder Natürlichkeit noch Ausdruck oder persönliche Hörpräferenzen direkt. Das Leaderboard bietet daneben eine Listen-Ansicht, in der sich generierte Ausgaben vergleichen und bewerten lassen. Hugging Face beschreibt das Angebot als gemeinschaftlich weiterzuentwickelndes Projekt.
