Modelle · lokal (eigene GPU) · geprüft 2026-08-07

Whisper large-v3-turbo

OpenAI · MIT

Das Modell, das bei uns jede Aufnahme in Text verwandelt — und der seltene Fall, in dem ein US-Konzern etwas unter MIT-Lizenz veröffentlicht hat. Es läuft auf allem, von der Grafikkarte bis zum ausgemusterten Büro-PC.

Anbieter
OpenAI
Tier
lokal (eigene GPU)
Lizenz
MIT
Gewichte
offen (self-hostbar)
Selbst betrieben
ja
Parameter
809 Mio
Modalitäten
Sprache hören
Erschienen
2024-10
Unsere Sicht

Einschätzung

  • Whisper ist der Grund, warum Spracherkennung im Verein keine Cloud-Frage mehr ist. Die Gewichte stehen unter MIT — keine Nutzungsbeschränkung, keine Umsatzschwelle, keine Anmeldung. Wer sie lädt, darf damit machen, was er will. Das ist bei offenen Modellen heute die Ausnahme, nicht die Regel.
  • Die „turbo"-Fassung ist die kleine mit vier statt zweiunddreißig Dekodier-Schichten. Wir haben sie gegen die große large-v3 gemessen: Sie ist schneller **und** in unserem Material minimal genauer. Der Griff zum größeren Modell hätte hier nur Zeit gekostet.
  • Der wichtigste Befund war aber gar keiner über das Modell. Dieselben Gewichte laufen je nach Laufzeitumgebung um den Faktor vier verschieden schnell — bei praktisch gleicher Genauigkeit. Wer die Modellwahl für die entscheidende Schraube hält, dreht an der falschen.
Stärken
  • MIT-Lizenz: keine kommerzielle Einschränkung, keine Anmeldung.
  • Läuft von der RTX 3090 bis zum ausgemusterten Büro-PC von 2017.
  • Rund 9 % Wortfehler auf vorgelesenem Deutsch, unabhängig von der Maschine.
Grenzen
  • Auf Telefonqualität steigt die Fehlerrate auf das Zwei- bis Dreifache.
  • Sprechertrennung und Zeitmarken liefert es nicht selbst — dafür braucht es WhisperX obendrauf.
  • Eigennamen und Ortsnamen verunglücken zuverlässig; das trifft im Bodenseeraum oft.
Im Verein

Wo wir es einsetzen

  • memoro — Sprachnotizen verschriftlichen (über den Dienst auf der GPU-Box).
  • Der Ausweichweg auf einem Büro-PC, wenn die Grafikkarte ausfällt.
Notizen

Wie schnell und wie genau dieses Modell auf unseren drei Maschinen arbeitet — und warum die Grafikkarte trotz 247 Watt weniger Strom je Stunde Aufnahme braucht als ein 37-Watt-Büro-PC — steht im Vergleich Alle Maschinen, dieselbe Aufgabe. Dass die Laufzeitumgebung dabei mehr ausmacht als die Modellwahl, ist gesondert nachgemessen: Spracherkennung auf einem zehn Jahre alten Büro-PC.

Ein Steckbrief sagt, was ein Modell ist. Welches Modell eine konkrete Aufgabe gewinnt, entscheiden wir nicht aus dem Bauch, sondern messen es — Qualität gegen Kosten, pro Operation.