Modelle · lokal (eigene GPU) · geprüft 2026-08-01

Qwen3-TTS 1.7B

Alibaba · Apache-2.0

Die Stimme, die spricht, wenn eine unserer Apps vorliest. Sie hat sich in zwei blinden Durchgängen gegen neun Mitbewerber durchgesetzt — und sie löst nebenbei ein Problem, das keine Messung sichtbar macht: Sie braucht keinen menschlichen Stimmspender.

Anbieter
Alibaba
Tier
lokal (eigene GPU)
Lizenz
Apache-2.0
Gewichte
offen (self-hostbar)
Selbst betrieben
ja
Parameter
1,7 Mrd
Modalitäten
Sprache sprechen
Unsere Sicht

Einschätzung

  • Wir haben zehn Sprachausgabe-Modelle gegeneinander laufen lassen, objektiv und blind. Objektiv heißt: Text sprechen lassen, das Ergebnis wieder verschriftlichen, die Abweichung zählen. Blind heißt: zwei Hörproben nebeneinander, Namen erst nach der Wahl. Qwen3-TTS gewinnt beides — 5,2 % Wortfehler, gleichauf mit der objektiv besten Engine, und im Direktvergleich klar vor unserer vorherigen Standardstimme.
  • Der eigentliche Grund für den Wechsel steht aber nicht in der Tabelle. Unsere frühere deutsche Premiumstimme war auf Aufnahmen trainiert, deren Sprecherinnen und Sprecher dem Klonen ihrer Stimme nie zugestimmt hatten. Technisch ging es, rechtlich war es eine Grauzone, und moralisch war es keine. Qwen3-TTS kann eine Stimme aus einer reinen Textbeschreibung erzeugen — ohne Spender, ohne Einwilligungsfrage.
  • Dass ausgerechnet ein chinesisches Modell hier gewinnt, ist unbequem und bleibt trotzdem stehen: Es läuft vollständig auf unserer eigenen Hardware, die Gewichte sind Apache-2.0, und kein Ton verlässt das Haus. Souveränität ist die Frage, wo gerechnet wird — nicht die Frage, welche Flagge auf dem Modell klebt.
Stärken
  • Apache-2.0 — die sauberste Lizenzlage im ganzen Sprachausgabe-Feld.
  • Stimme aus Textbeschreibung: kein menschlicher Spender, keine Einwilligungsfrage.
  • Blind gewählt, nicht nach Datenblatt: gewinnt objektiv und im Hörvergleich.
Grenzen
  • Eigennamen verunglücken auch hier — Ortsnamen aus der Region sitzen nicht zuverlässig.
  • Läuft als eigener Prozess neben dem Dienst, weil sich seine Abhängigkeiten mit denen der anderen Engines beißen.
  • Für Englisch nie gegen ein Prüfset gemessen — wir bauen deutsch zuerst.
Im Verein

Wo wir es einsetzen

  • Standardstimme des Sprachausgabe-Dienstes — überall dort, wo eine App keine eigene nennt.
  • Audioguide für das Haus der Kunstgeschichte (14 Stationen).
  • Die Kinder-Apps sprechen zwei eigens ausgewählte Stimmen aus derselben Engine.
Notizen

Alle Stimmen, die dieses Modell bei uns spricht, stehen mit derselben Hörprobe nebeneinander unter Stimmen — inklusive Blindvergleich, damit man die eigene Wahl nicht vom Namen beeinflussen lässt.

Ein Steckbrief sagt, was ein Modell ist. Welches Modell eine konkrete Aufgabe gewinnt, entscheiden wir nicht aus dem Bauch, sondern messen es — Qualität gegen Kosten, pro Operation.