Stimmen · Text-to-Speech · Eigenbetrieb

So klingt eine Vereins-App, wenn niemandmithört.

Wenn Pageta einen Artikel vorliest oder ein Audioguide durch eine Ausstellung führt, läuft die Sprachausgabe auf unserer eigenen Grafikkarte — nicht bei ElevenLabs. Das kostet Qualität, und wir zeigen hier ehrlich, wie viel: jede Stimme, die diese Box sprechen kann, mit derselben Hörprobe, dem Lizenz-Status und der gemessenen Fehlerrate aus unserem Eval-Harness.

  • 54 Stimmen
  • 27 deutsch
  • 50 lokal gerechnet
  • 7 kuratiert

43 von 54 Stimmen haben aktuell eine Hörprobe.

Unsere Stimmen

7 Stimmen mit Rolle — ausgewählt in zwei blinden Durchgängen aus 13 Kandidaten. Alle sind im Einsatz, eine davon ist der Standard: Mira (ruhig) spricht überall dort, wo eine App keine Stimme nennt.

Eine ist der Standard: Mira (ruhig). Seit dem 2. August 2026 spricht sie überall dort, wo ein Aufruf keine Stimme nennt — davor tat das eine Stimme, die eine fremde Aufnahme nachbildet. Sie hat die beste Kurzprobe der sieben und den Ton, den das meiste trifft, was unsere Apps sagen: vorlesen, erklären, führen. Es ist dieselbe Sprecherin wie Mira, nur angewiesen, ruhig und sachlich zu sprechen. Wo Kinder zuhören, wählen die Apps weiterhin Anna oder Jonas — dafür sind die Rollen da.

Vier von ihnen hat niemand gesprochen. Sie sind aus einer Beschreibung entworfen — „ruhig, warm, geerdet, für Audioguides". Es gibt keinen Menschen, dessen Einwilligung fehlen könnte, und keine Aufnahme, deren Herkunft wir belegen müssten. Das löst das Problem, an dem unsere älteren Stimmen hängen, statt es zu verwalten.

Drei sind mitgelieferte Sprecher des Modells, und keiner davon ist deutscher Muttersprachler. Beim Vorlesen hört man das kaum, bei Zahlen und Ortsnamen eher. Zwei davon sind dieselbe Sprecherin — einmal wie sie ist, einmal angewiesen, ruhig und sachlich zu sprechen.

Ausgewählt wurde blind. Aus dreizehn Kandidaten in zwei Durchgängen, Namen verdeckt und Reihenfolge gemischt, mit Sätzen aus dem echten Einsatz: Spielanweisungen für die Kinder-Apps, Vorlese- und Audioguide-Absätze für den Rest. Wir setzen alle sieben ein statt einer — welche sich hält, zeigt der Gebrauch.

„Hallo, ich bin eine der Stimmen des Vereins mana. So klinge ich, wenn ich einen Text ruhig und deutlich vorlese."

  • Mira (ruhig)Stimme 1Qwen3-TTS · CustomVoiceStandardlokalmana allgemein1,3 % Kurzprobe
    Dieselbe Stimme, ruhig und sachlich instruiert
    Mitgelieferter Sprecher des Modells — im Deutschen zweitsprachlich, hörbar vor allem bei Zahlen und Eigennamen.
  • AnnaStimme 2Qwen3-TTS · CustomVoicelokalKistli & Kinder-Apps1,3 % Kurzprobe
    Hell und verspielt — für Kinder-Apps
  • JonasStimme 3Qwen3-TTS · VoiceDesignlokalKistli & Kinder-Apps1,3 % Kurzprobe
    Warm und spielerisch, wie ein grosser Bruder — für Kinder-Apps
    Aus einer Textbeschreibung entworfen, nicht von einem Menschen geklont — es gibt keinen Spender, dessen Einwilligung fehlen könnte.
  • LeneStimme 4Qwen3-TTS · VoiceDesignlokalmana allgemein2,6 % Kurzprobe
    Ruhig, geerdet, entworfen für Audioguides
  • MiraStimme 5Qwen3-TTS · CustomVoicelokalmana allgemein2,6 % Kurzprobe
    Warm und emotionsreich — Vereinsstimme
    Mitgelieferter Sprecher des Modells — im Deutschen zweitsprachlich, hörbar vor allem bei Zahlen und Eigennamen.
  • TheoStimme 6Qwen3-TTS · VoiceDesignlokalmana allgemein1,3 % Kurzprobe
    Ruhig und unaufgeregt, entworfen zum Vorlesen
    Aus einer Textbeschreibung entworfen, nicht von einem Menschen geklont — es gibt keinen Spender, dessen Einwilligung fehlen könnte.
  • Theo (nachdenklich)Stimme 7Qwen3-TTS · VoiceDesignlokalmana allgemein1,3 % Kurzprobe
    Mit natürlichen Pausen, entworfen für längere Texte

Deutsch — Bestand

20 weitere deutsche Stimmen, die der Dienst versteht: die geklonte Vorgänger-Stimme, zwei gemeinfreie Piper-Stimmen, das Orpheus-Erbe und vier Cloud-Stimmen.

„Hallo, ich bin eine der Stimmen des Vereins mana. So klinge ich, wenn ich einen Text ruhig und deutlich vorlese."

  • KerstinStimme 1Piperlokal4,7 % Fehler2,7 % Kurzprobe
    Deutsche Frauenstimme (lokal, schnell)
    beste WER — klingt aber roboterhaft
  • ThorstenStimme 2Piperlokal5,1 % Fehler5,2 % Kurzprobe
    Deutsche Männerstimme (lokal, schnell)
    Referenzstimme, aus der die Qwen-Stimme geklont ist
  • Qwen (DE)Stimme 3Qwen3-TTSlokal5,2 % Fehler5,3 % Kurzprobe
    Deutsche Stimme, geklont aus einer CC0-Referenz — Sieger der Lab-Messung
    gewinnt den Blind-A/B gegen alle Orpheus-Sprecher
    Der Sidecar hält eine feste Referenzstimme — deshalb gibt es genau eine Qwen-Stimme, obwohl das Modell klonen kann. War bis zum 2026-08-02 die Standard-Stimme, jetzt Rückfallebene.
  • JakobStimme 4Orpheus-3BlokalLizenz ungeklärt7,3 % Fehler
    Männlich, natürlich (Standard)
    bester Orpheus-Sprecher, aber Blind-A/B nur Mittelfeld
    Trainingsdaten aus OER-Podcasts ohne Cloning-Einwilligung der Sprecher — bis zur Klärung nur intern verwenden (lab/VOICE_PROVENANCE_AUDIT.md).
  • LeaStimme 5Orpheus-3BlokalLizenz ungeklärt10,6 % Fehler
    Weiblich, weich
  • FelixStimme 6Orpheus-3BlokalLizenz ungeklärt12,2 % Fehler
    Männlich, warm
    schlechtester im Blind-A/B (0 von 5 Duellen)
  • MaximilianStimme 7Orpheus-3BlokalLizenz ungeklärt12,7 % Fehler
    Männlich, sachlich
    im Blind-A/B stark, verliert aber gegen Qwen
    Noch keine Hörprobe gebacken.
  • SophieStimme 8Orpheus-3BlokalLizenz ungeklärt15,3 % Fehler
    Weiblich, natürlich
    Noch keine Hörprobe gebacken.
  • AlexanderStimme 9Orpheus-3BlokalLizenz ungeklärt
    Männlich, klar
    Noch keine Hörprobe gebacken.
  • AntonStimme 10Orpheus-3BlokalLizenz ungeklärt
    Männlich, ruhig
    Noch keine Hörprobe gebacken.
  • JulianStimme 11Orpheus-3BlokalLizenz ungeklärt
    Männlich, freundlich
    Noch keine Hörprobe gebacken.
  • LinaStimme 12Orpheus-3BlokalLizenz ungeklärt
    Weiblich, jung
    Noch keine Hörprobe gebacken.
  • MariaStimme 13Orpheus-3BlokalLizenz ungeklärt
    Weiblich, ruhig
    Noch keine Hörprobe gebacken.
  • MarieStimme 14Orpheus-3BlokalLizenz ungeklärt
    Weiblich, freundlich
    Noch keine Hörprobe gebacken.
  • MiaStimme 15Orpheus-3BlokalLizenz ungeklärt
    Weiblich, hell
    Noch keine Hörprobe gebacken.
  • SophiaStimme 16Orpheus-3BlokalLizenz ungeklärt
    Weiblich, klar
    Noch keine Hörprobe gebacken.
  • AmalaStimme 17Edge TTSCloud
    Deutsche Frauenstimme jung (Cloud)
    Text verlässt die eigene Infrastruktur und geht an Microsoft.
  • ConradStimme 18Edge TTSCloud
    Deutsche Männerstimme (Cloud)
  • FlorianStimme 19Edge TTSClouddefekt
    Deutsche Männerstimme jung (Cloud)
    antwortet mit Fehler 500 — Microsoft-Stimme offenbar abgekündigt (2026-07-31)
  • KatjaStimme 20Edge TTSCloud
    Deutsche Frauenstimme (Cloud)

English

27 Stimmen aus einem einzigen Modell (Kokoro-82M, Apache-2.0, 82 Millionen Parameter). Nie gegen ein Eval-Set gemessen — wir bauen deutsch-first.

„Hello, I am one of the voices of the mana association. This is how I sound when I read a text calmly and clearly."

  • HeartStimme 1Kokoro-82Mempfohlenlokal
    American Female - Heart (warm, emotional)
  • AdamStimme 2Kokoro-82Mlokal
    American Male - Adam (deep, authoritative)
  • AliceStimme 3Kokoro-82Mlokal
    British Female - Alice (refined, elegant)
  • AlloyStimme 4Kokoro-82Mlokal
    American Female - Alloy (neutral, professional)
  • AoedeStimme 5Kokoro-82Mlokal
    American Female - Aoede (clear, articulate)
  • BellaStimme 6Kokoro-82Mlokal
    American Female - Bella (friendly, approachable)
  • DanielStimme 7Kokoro-82Mlokal
    British Male - Daniel (classic, authoritative)
  • EchoStimme 8Kokoro-82Mlokal
    American Male - Echo (resonant, clear)
  • EmmaStimme 9Kokoro-82Mlokal
    British Female - Emma (clear, professional)
  • EricStimme 10Kokoro-82Mlokal
    American Male - Eric (professional, neutral)
  • FableStimme 11Kokoro-82Mlokal
    British Male - Fable (storyteller, expressive)
  • FenrirStimme 12Kokoro-82Mlokal
    American Male - Fenrir (strong, commanding)
  • GeorgeStimme 13Kokoro-82Mlokal
    British Male - George (traditional, clear)
  • IsabellaStimme 14Kokoro-82Mlokal
    British Female - Isabella (sophisticated, warm)
  • JessicaStimme 15Kokoro-82Mlokal
    American Female - Jessica (confident, clear)
  • KoreStimme 16Kokoro-82Mlokal
    American Female - Kore (calm, measured)
  • LewisStimme 17Kokoro-82Mlokal
    British Male - Lewis (modern, approachable)
  • LiamStimme 18Kokoro-82Mlokal
    American Male - Liam (friendly, casual)
  • LilyStimme 19Kokoro-82Mlokal
    British Female - Lily (soft, gentle)
  • MichaelStimme 20Kokoro-82Mlokal
    American Male - Michael (warm, trustworthy)
  • NicoleStimme 21Kokoro-82Mlokal
    American Female - Nicole (bright, energetic)
  • NovaStimme 22Kokoro-82Mlokal
    American Female - Nova (modern, dynamic)
  • OnyxStimme 23Kokoro-82Mlokal
    American Male - Onyx (deep, smooth)
  • PuckStimme 24Kokoro-82Mlokal
    American Male - Puck (playful, light)
  • RiverStimme 25Kokoro-82Mlokal
    American Female - River (smooth, flowing)
  • SarahStimme 26Kokoro-82Mlokal
    American Female - Sarah (warm, conversational)
  • SkyStimme 27Kokoro-82Mlokal
    American Female - Sky (light, airy)

Was hier noch nicht stimmt

Eine gute deutsche Stimme ist keine Auswahl. Die 13 Orpheus-Sprecher klingen im Blindtest fast identisch — die Sprecher-Konditionierung des Modells ist schwach. Und ihre Herkunft ist ungeklärt: trainiert auf frei lizenzierten Podcasts, aber ohne Einwilligung der Sprecher zum Klonen. Wir setzen sie deshalb nicht mehr als Standard ein.

Unsere Standard-Stimme ist nicht unsere. Sie ist ein mitgelieferter Sprecher des Modells: eine Person, die wir nicht kennen und nicht gefragt haben — das Modell bringt sie mit, die Lizenz erlaubt es. Davor stand eine Stimme im Standard, die eine gemeinfreie Piper-Aufnahme nachbildet; auch sauber, auch fremd. Sauber heisst nicht eigen. Die entworfenen Stimmen kopieren niemanden mehr, und der Schritt danach wäre eine selbst eingesprochene Vereinsstimme — die steht aus.

Zwei Messungen, zwei verschiedene Zahlen. „% Fehler" stammt aus unserem festen Prüfsatz mit 40 deutschen Sätzen. „% Kurzprobe" stammt aus zwei Sätzen — genug, um Kandidaten vorzusortieren, zu wenig für ein Urteil. Wir zeigen beides getrennt, statt eine Zahl zu bilden, die keine ist. Und beide messen nur, ob die Maschine den Text zurücklesen kann — nicht, ob eine Stimme angenehm klingt. Das entscheidet das Ohr, dafür ist der Blind-Modus da.

Von den 13 Orpheus-Stimmen sind nur drei zu hören.Das Erzeugen dieser Seite hat zwei Dinge zutage gefördert. Erstens einen Fehler bei uns: Ein Aufräum-Mechanismus, der ungenutzte Modelle aus dem Grafikspeicher wirft, hat nicht gemerkt, dass gerade noch gerechnet wird — und Orpheus mitten im Satz entladen. Das ist behoben. Zweitens etwas, das wir nicht beheben können: Das Modell läuft bei manchen Sätzen in eine Endlosschleife und liefert nie ein Ergebnis. Wer Jakob, Lea und Felix nacheinander anhört, versteht ohnehin das Wesentliche — die Sprecher klingen fast gleich. Genau deshalb ist Orpheus nicht mehr unsere Standard-Stimme.

Vier Stimmen gehen nach draußen. Die Edge-Stimmen sind ein Notnagel aus einer früheren Ausbaustufe: Der zu sprechende Text geht dafür an Microsoft. Sie stehen hier, weil Verschweigen schlimmer wäre — nicht, weil wir sie empfehlen. Eine davon antwortet inzwischen überhaupt nicht mehr; auch das steht hier, statt still aus der Liste zu verschwinden.

Die englischen Stimmen sind ungemessen. Unser Eval-Set ist deutsch. 27 Kokoro-Stimmen stehen hier ohne Fehlerrate — wir wissen nur, dass sie laufen, nicht wie gut.

Sieben Stimmen sind sechs zu viel — vielleicht. Wir hätten uns auf eine festlegen können. Stattdessen gehen alle in den Betrieb, weil sich im Gebrauch anderes zeigt als im Hörtest: ob eine Stimme nach zwanzig Minuten noch trägt, ob Kinder ihr zuhören, ob sie einen Ortsnamen zweimal gleich ausspricht. Was liegen bleibt, nehmen wir später wieder heraus.

Methodik und vollständige Messwerte:mana-tts/lab/EVAL_RESULTS.md. Hörproben gebacken am 2026-08-01.