Stimmen · Text-to-Speech · Eigenbetrieb

So klingt eine Vereins-App, wenn niemand mithört.

Wenn Pageta einen Artikel vorliest oder ein Audioguide durch eine Ausstellung führt, läuft die Sprachausgabe auf unserer eigenen Grafikkarte — nicht bei ElevenLabs. Das kostet Qualität, und wir zeigen hier ehrlich, wie viel: jede Stimme, die diese Box sprechen kann, mit derselben Hörprobe, dem Lizenz-Status und der gemessenen Fehlerrate aus unserem Eval-Harness.

  • 54 Stimmen
  • 27 deutsch
  • 50 lokal gerechnet
  • 7 kuratiert

43 von 54 Stimmen haben aktuell eine Hörprobe.

Unsere Stimmen

7 Stimmen mit Rolle — ausgewählt in zwei blinden Durchgängen aus 13 Kandidaten. Alle sind im Einsatz, eine davon ist der Standard: Mira (ruhig) spricht überall dort, wo eine App keine Stimme nennt.

Eine ist der Standard: Mira (ruhig). Seit dem 2. August 2026 spricht sie überall dort, wo ein Aufruf keine Stimme nennt — davor tat das eine Stimme, die eine fremde Aufnahme nachbildet. Sie hat die beste Kurzprobe der sieben und den Ton, den das meiste trifft, was unsere Apps sagen: vorlesen, erklären, führen. Es ist dieselbe Sprecherin wie Mira, nur angewiesen, ruhig und sachlich zu sprechen. Wo Kinder zuhören, wählen die Apps weiterhin Anna oder Jonas — dafür sind die Rollen da.

Vier von ihnen hat niemand gesprochen. Sie sind aus einer Beschreibung entworfen — „ruhig, warm, geerdet, für Audioguides". Es gibt keinen Menschen, dessen Einwilligung fehlen könnte, und keine Aufnahme, deren Herkunft wir belegen müssten. Das löst das Problem, an dem unsere älteren Stimmen hängen, statt es zu verwalten.

Drei sind mitgelieferte Sprecher des Modells, und keiner davon ist deutscher Muttersprachler. Beim Vorlesen hört man das kaum, bei Zahlen und Ortsnamen eher. Zwei davon sind dieselbe Sprecherin — einmal wie sie ist, einmal angewiesen, ruhig und sachlich zu sprechen.

Ausgewählt wurde blind. Aus dreizehn Kandidaten in zwei Durchgängen, Namen verdeckt und Reihenfolge gemischt, mit Sätzen aus dem echten Einsatz: Spielanweisungen für die Kinder-Apps, Vorlese- und Audioguide-Absätze für den Rest. Wir setzen alle sieben ein statt einer — welche sich hält, zeigt der Gebrauch.

„Hallo, ich bin eine der Stimmen des Vereins mana. So klinge ich, wenn ich einen Text ruhig und deutlich vorlese."

  • Mira (ruhig) Stimme 1 Qwen3-TTS · CustomVoice Standard lokal mana allgemein 1,3 % Kurzprobe
    Dieselbe Stimme, ruhig und sachlich instruiert
    Mitgelieferter Sprecher des Modells — im Deutschen zweitsprachlich, hörbar vor allem bei Zahlen und Eigennamen.
  • Anna Stimme 2 Qwen3-TTS · CustomVoice lokal Kistli & Kinder-Apps 1,3 % Kurzprobe
    Hell und verspielt — für Kinder-Apps
  • Jonas Stimme 3 Qwen3-TTS · VoiceDesign lokal Kistli & Kinder-Apps 1,3 % Kurzprobe
    Warm und spielerisch, wie ein grosser Bruder — für Kinder-Apps
    Aus einer Textbeschreibung entworfen, nicht von einem Menschen geklont — es gibt keinen Spender, dessen Einwilligung fehlen könnte.
  • Lene Stimme 4 Qwen3-TTS · VoiceDesign lokal mana allgemein 2,6 % Kurzprobe
    Ruhig, geerdet, entworfen für Audioguides
  • Mira Stimme 5 Qwen3-TTS · CustomVoice lokal mana allgemein 2,6 % Kurzprobe
    Warm und emotionsreich — Vereinsstimme
    Mitgelieferter Sprecher des Modells — im Deutschen zweitsprachlich, hörbar vor allem bei Zahlen und Eigennamen.
  • Theo Stimme 6 Qwen3-TTS · VoiceDesign lokal mana allgemein 1,3 % Kurzprobe
    Ruhig und unaufgeregt, entworfen zum Vorlesen
    Aus einer Textbeschreibung entworfen, nicht von einem Menschen geklont — es gibt keinen Spender, dessen Einwilligung fehlen könnte.
  • Theo (nachdenklich) Stimme 7 Qwen3-TTS · VoiceDesign lokal mana allgemein 1,3 % Kurzprobe
    Mit natürlichen Pausen, entworfen für längere Texte

Deutsch — Bestand

20 weitere deutsche Stimmen, die der Dienst versteht: die geklonte Vorgänger-Stimme, zwei gemeinfreie Piper-Stimmen, das Orpheus-Erbe und vier Cloud-Stimmen.

„Hallo, ich bin eine der Stimmen des Vereins mana. So klinge ich, wenn ich einen Text ruhig und deutlich vorlese."

  • Kerstin Stimme 1 Piper lokal 4,7 % Fehler 2,7 % Kurzprobe
    Deutsche Frauenstimme (lokal, schnell)
    beste WER — klingt aber roboterhaft
  • Thorsten Stimme 2 Piper lokal 5,1 % Fehler 5,2 % Kurzprobe
    Deutsche Männerstimme (lokal, schnell)
    Referenzstimme, aus der die Qwen-Stimme geklont ist
  • Qwen (DE) Stimme 3 Qwen3-TTS lokal 5,2 % Fehler 5,3 % Kurzprobe
    Deutsche Stimme, geklont aus einer CC0-Referenz — Sieger der Lab-Messung
    gewinnt den Blind-A/B gegen alle Orpheus-Sprecher
    Der Sidecar hält eine feste Referenzstimme — deshalb gibt es genau eine Qwen-Stimme, obwohl das Modell klonen kann. War bis zum 2026-08-02 die Standard-Stimme, jetzt Rückfallebene.
  • Jakob Stimme 4 Orpheus-3B lokal Lizenz ungeklärt 7,3 % Fehler
    Männlich, natürlich (Standard)
    bester Orpheus-Sprecher, aber Blind-A/B nur Mittelfeld
    Trainingsdaten aus OER-Podcasts ohne Cloning-Einwilligung der Sprecher — bis zur Klärung nur intern verwenden (lab/VOICE_PROVENANCE_AUDIT.md).
  • Lea Stimme 5 Orpheus-3B lokal Lizenz ungeklärt 10,6 % Fehler
    Weiblich, weich
  • Felix Stimme 6 Orpheus-3B lokal Lizenz ungeklärt 12,2 % Fehler
    Männlich, warm
    schlechtester im Blind-A/B (0 von 5 Duellen)
  • Maximilian Stimme 7 Orpheus-3B lokal Lizenz ungeklärt 12,7 % Fehler
    Männlich, sachlich
    im Blind-A/B stark, verliert aber gegen Qwen
    Noch keine Hörprobe gebacken.
  • Sophie Stimme 8 Orpheus-3B lokal Lizenz ungeklärt 15,3 % Fehler
    Weiblich, natürlich
    Noch keine Hörprobe gebacken.
  • Alexander Stimme 9 Orpheus-3B lokal Lizenz ungeklärt
    Männlich, klar
    Noch keine Hörprobe gebacken.
  • Anton Stimme 10 Orpheus-3B lokal Lizenz ungeklärt
    Männlich, ruhig
    Noch keine Hörprobe gebacken.
  • Julian Stimme 11 Orpheus-3B lokal Lizenz ungeklärt
    Männlich, freundlich
    Noch keine Hörprobe gebacken.
  • Lina Stimme 12 Orpheus-3B lokal Lizenz ungeklärt
    Weiblich, jung
    Noch keine Hörprobe gebacken.
  • Maria Stimme 13 Orpheus-3B lokal Lizenz ungeklärt
    Weiblich, ruhig
    Noch keine Hörprobe gebacken.
  • Marie Stimme 14 Orpheus-3B lokal Lizenz ungeklärt
    Weiblich, freundlich
    Noch keine Hörprobe gebacken.
  • Mia Stimme 15 Orpheus-3B lokal Lizenz ungeklärt
    Weiblich, hell
    Noch keine Hörprobe gebacken.
  • Sophia Stimme 16 Orpheus-3B lokal Lizenz ungeklärt
    Weiblich, klar
    Noch keine Hörprobe gebacken.
  • Amala Stimme 17 Edge TTS Cloud
    Deutsche Frauenstimme jung (Cloud)
    Text verlässt die eigene Infrastruktur und geht an Microsoft.
  • Conrad Stimme 18 Edge TTS Cloud
    Deutsche Männerstimme (Cloud)
  • Florian Stimme 19 Edge TTS Cloud defekt
    Deutsche Männerstimme jung (Cloud)
    antwortet mit Fehler 500 — Microsoft-Stimme offenbar abgekündigt (2026-07-31)
  • Katja Stimme 20 Edge TTS Cloud
    Deutsche Frauenstimme (Cloud)

English

27 Stimmen aus einem einzigen Modell (Kokoro-82M, Apache-2.0, 82 Millionen Parameter). Nie gegen ein Eval-Set gemessen — wir bauen deutsch-first.

„Hello, I am one of the voices of the mana association. This is how I sound when I read a text calmly and clearly."

  • Heart Stimme 1 Kokoro-82M empfohlen lokal
    American Female - Heart (warm, emotional)
  • Adam Stimme 2 Kokoro-82M lokal
    American Male - Adam (deep, authoritative)
  • Alice Stimme 3 Kokoro-82M lokal
    British Female - Alice (refined, elegant)
  • Alloy Stimme 4 Kokoro-82M lokal
    American Female - Alloy (neutral, professional)
  • Aoede Stimme 5 Kokoro-82M lokal
    American Female - Aoede (clear, articulate)
  • Bella Stimme 6 Kokoro-82M lokal
    American Female - Bella (friendly, approachable)
  • Daniel Stimme 7 Kokoro-82M lokal
    British Male - Daniel (classic, authoritative)
  • Echo Stimme 8 Kokoro-82M lokal
    American Male - Echo (resonant, clear)
  • Emma Stimme 9 Kokoro-82M lokal
    British Female - Emma (clear, professional)
  • Eric Stimme 10 Kokoro-82M lokal
    American Male - Eric (professional, neutral)
  • Fable Stimme 11 Kokoro-82M lokal
    British Male - Fable (storyteller, expressive)
  • Fenrir Stimme 12 Kokoro-82M lokal
    American Male - Fenrir (strong, commanding)
  • George Stimme 13 Kokoro-82M lokal
    British Male - George (traditional, clear)
  • Isabella Stimme 14 Kokoro-82M lokal
    British Female - Isabella (sophisticated, warm)
  • Jessica Stimme 15 Kokoro-82M lokal
    American Female - Jessica (confident, clear)
  • Kore Stimme 16 Kokoro-82M lokal
    American Female - Kore (calm, measured)
  • Lewis Stimme 17 Kokoro-82M lokal
    British Male - Lewis (modern, approachable)
  • Liam Stimme 18 Kokoro-82M lokal
    American Male - Liam (friendly, casual)
  • Lily Stimme 19 Kokoro-82M lokal
    British Female - Lily (soft, gentle)
  • Michael Stimme 20 Kokoro-82M lokal
    American Male - Michael (warm, trustworthy)
  • Nicole Stimme 21 Kokoro-82M lokal
    American Female - Nicole (bright, energetic)
  • Nova Stimme 22 Kokoro-82M lokal
    American Female - Nova (modern, dynamic)
  • Onyx Stimme 23 Kokoro-82M lokal
    American Male - Onyx (deep, smooth)
  • Puck Stimme 24 Kokoro-82M lokal
    American Male - Puck (playful, light)
  • River Stimme 25 Kokoro-82M lokal
    American Female - River (smooth, flowing)
  • Sarah Stimme 26 Kokoro-82M lokal
    American Female - Sarah (warm, conversational)
  • Sky Stimme 27 Kokoro-82M lokal
    American Female - Sky (light, airy)

Was hier noch nicht stimmt

Eine gute deutsche Stimme ist keine Auswahl. Die 13 Orpheus-Sprecher klingen im Blindtest fast identisch — die Sprecher-Konditionierung des Modells ist schwach. Und ihre Herkunft ist ungeklärt: trainiert auf frei lizenzierten Podcasts, aber ohne Einwilligung der Sprecher zum Klonen. Wir setzen sie deshalb nicht mehr als Standard ein.

Unsere Standard-Stimme ist nicht unsere. Sie ist ein mitgelieferter Sprecher des Modells: eine Person, die wir nicht kennen und nicht gefragt haben — das Modell bringt sie mit, die Lizenz erlaubt es. Davor stand eine Stimme im Standard, die eine gemeinfreie Piper-Aufnahme nachbildet; auch sauber, auch fremd. Sauber heisst nicht eigen. Die entworfenen Stimmen kopieren niemanden mehr, und der Schritt danach wäre eine selbst eingesprochene Vereinsstimme — die steht aus.

Zwei Messungen, zwei verschiedene Zahlen. „% Fehler" stammt aus unserem festen Prüfsatz mit 40 deutschen Sätzen. „% Kurzprobe" stammt aus zwei Sätzen — genug, um Kandidaten vorzusortieren, zu wenig für ein Urteil. Wir zeigen beides getrennt, statt eine Zahl zu bilden, die keine ist. Und beide messen nur, ob die Maschine den Text zurücklesen kann — nicht, ob eine Stimme angenehm klingt. Das entscheidet das Ohr, dafür ist der Blind-Modus da.

Von den 13 Orpheus-Stimmen sind nur drei zu hören. Das Erzeugen dieser Seite hat zwei Dinge zutage gefördert. Erstens einen Fehler bei uns: Ein Aufräum-Mechanismus, der ungenutzte Modelle aus dem Grafikspeicher wirft, hat nicht gemerkt, dass gerade noch gerechnet wird — und Orpheus mitten im Satz entladen. Das ist behoben. Zweitens etwas, das wir nicht beheben können: Das Modell läuft bei manchen Sätzen in eine Endlosschleife und liefert nie ein Ergebnis. Wer Jakob, Lea und Felix nacheinander anhört, versteht ohnehin das Wesentliche — die Sprecher klingen fast gleich. Genau deshalb ist Orpheus nicht mehr unsere Standard-Stimme.

Vier Stimmen gehen nach draußen. Die Edge-Stimmen sind ein Notnagel aus einer früheren Ausbaustufe: Der zu sprechende Text geht dafür an Microsoft. Sie stehen hier, weil Verschweigen schlimmer wäre — nicht, weil wir sie empfehlen. Eine davon antwortet inzwischen überhaupt nicht mehr; auch das steht hier, statt still aus der Liste zu verschwinden.

Die englischen Stimmen sind ungemessen. Unser Eval-Set ist deutsch. 27 Kokoro-Stimmen stehen hier ohne Fehlerrate — wir wissen nur, dass sie laufen, nicht wie gut.

Sieben Stimmen sind sechs zu viel — vielleicht. Wir hätten uns auf eine festlegen können. Stattdessen gehen alle in den Betrieb, weil sich im Gebrauch anderes zeigt als im Hörtest: ob eine Stimme nach zwanzig Minuten noch trägt, ob Kinder ihr zuhören, ob sie einen Ortsnamen zweimal gleich ausspricht. Was liegen bleibt, nehmen wir später wieder heraus.

Methodik und vollständige Messwerte: mana-tts/lab/EVAL_RESULTS.md. Hörproben gebacken am 2026-08-01.