Qwen3-TTS 1.7B
Alibaba · Apache-2.0
Die Stimme, die spricht, wenn eine unserer Apps vorliest. Sie hat sich in zwei blinden Durchgängen gegen neun Mitbewerber durchgesetzt — und sie löst nebenbei ein Problem, das keine Messung sichtbar macht: Sie braucht keinen menschlichen Stimmspender.
- Anbieter
- Alibaba
- Tier
- lokal (eigene GPU)
- Lizenz
- Apache-2.0
- Gewichte
- offen (self-hostbar)
- Selbst betrieben
- ja
- Parameter
- 1,7 Mrd
- Modalitäten
- Sprache sprechen
Unsere Sicht
Einschätzung
- Wir haben zehn Sprachausgabe-Modelle gegeneinander laufen lassen, objektiv und blind. Objektiv heißt: Text sprechen lassen, das Ergebnis wieder verschriftlichen, die Abweichung zählen. Blind heißt: zwei Hörproben nebeneinander, Namen erst nach der Wahl. Qwen3-TTS gewinnt beides — 5,2 % Wortfehler, gleichauf mit der objektiv besten Engine, und im Direktvergleich klar vor unserer vorherigen Standardstimme.
- Der eigentliche Grund für den Wechsel steht aber nicht in der Tabelle. Unsere frühere deutsche Premiumstimme war auf Aufnahmen trainiert, deren Sprecherinnen und Sprecher dem Klonen ihrer Stimme nie zugestimmt hatten. Technisch ging es, rechtlich war es eine Grauzone, und moralisch war es keine. Qwen3-TTS kann eine Stimme aus einer reinen Textbeschreibung erzeugen — ohne Spender, ohne Einwilligungsfrage.
- Dass ausgerechnet ein chinesisches Modell hier gewinnt, ist unbequem und bleibt trotzdem stehen: Es läuft vollständig auf unserer eigenen Hardware, die Gewichte sind Apache-2.0, und kein Ton verlässt das Haus. Souveränität ist die Frage, wo gerechnet wird — nicht die Frage, welche Flagge auf dem Modell klebt.
Stärken
- Apache-2.0 — die sauberste Lizenzlage im ganzen Sprachausgabe-Feld.
- Stimme aus Textbeschreibung: kein menschlicher Spender, keine Einwilligungsfrage.
- Blind gewählt, nicht nach Datenblatt: gewinnt objektiv und im Hörvergleich.
Grenzen
- Eigennamen verunglücken auch hier — Ortsnamen aus der Region sitzen nicht zuverlässig.
- Läuft als eigener Prozess neben dem Dienst, weil sich seine Abhängigkeiten mit denen der anderen Engines beißen.
- Für Englisch nie gegen ein Prüfset gemessen — wir bauen deutsch zuerst.
Im Verein
Wo wir es einsetzen
- Standardstimme des Sprachausgabe-Dienstes — überall dort, wo eine App keine eigene nennt.
- Audioguide für das Haus der Kunstgeschichte (14 Stationen).
- Die Kinder-Apps sprechen zwei eigens ausgewählte Stimmen aus derselben Engine.
Notizen
Alle Stimmen, die dieses Modell bei uns spricht, stehen mit derselben Hörprobe nebeneinander unter Stimmen — inklusive Blindvergleich, damit man die eigene Wahl nicht vom Namen beeinflussen lässt.
Modelle
Weitere Steckbriefe
-
lokal (eigene GPU)Gemma 4 12B
-
lokal (eigene GPU)Whisper large-v3-turbo
-
lokal (eigene GPU)FLUX.2 [klein] 4B
-
lokal (eigene GPU)ACE-Step
-
lokal (eigene GPU)MusicGen
-
on-deviceQwen2.5 0.5B
-
lokal (eigene GPU)TRELLIS
-
lokal (eigene GPU)HTDemucs v4
-
lokal (eigene GPU)Pixtral 12B
-
lokal (eigene GPU)Ideogram 4.0
-
lokal (eigene GPU)SenseNova U1.5 8B-MoT
-
lokal (eigene GPU)Qwen-Image-Edit 2511
-
ChinaMiniMax H3
-
ChinaMiniMax Music 3
Ein Steckbrief sagt, was ein Modell ist. Welches Modell eine konkrete Aufgabe gewinnt, entscheiden wir nicht aus dem Bauch, sondern messen es — Qualität gegen Kosten, pro Operation.