Whisper large-v3-turbo
Das Modell, das bei uns jede Aufnahme in Text verwandelt — und der seltene Fall, in dem ein US-Konzern etwas unter MIT-Lizenz veröffentlicht hat. Es läuft auf allem, von der Grafikkarte bis zum ausgemusterten Büro-PC.
- Anbieter
- OpenAI
- Tier
- lokal (eigene GPU)
- Lizenz
- MIT
- Gewichte
- offen (self-hostbar)
- Selbst betrieben
- ja
- Parameter
- 809 Mio
- Modalitäten
- Sprache hören
- Erschienen
- 2024-10
Einschätzung
- Whisper ist der Grund, warum Spracherkennung im Verein keine Cloud-Frage mehr ist. Die Gewichte stehen unter MIT — keine Nutzungsbeschränkung, keine Umsatzschwelle, keine Anmeldung. Wer sie lädt, darf damit machen, was er will. Das ist bei offenen Modellen heute die Ausnahme, nicht die Regel.
- Die „turbo"-Fassung ist die kleine mit vier statt zweiunddreißig Dekodier-Schichten. Wir haben sie gegen die große large-v3 gemessen: Sie ist schneller **und** in unserem Material minimal genauer. Der Griff zum größeren Modell hätte hier nur Zeit gekostet.
- Der wichtigste Befund war aber gar keiner über das Modell. Dieselben Gewichte laufen je nach Laufzeitumgebung um den Faktor vier verschieden schnell — bei praktisch gleicher Genauigkeit. Wer die Modellwahl für die entscheidende Schraube hält, dreht an der falschen.
- MIT-Lizenz: keine kommerzielle Einschränkung, keine Anmeldung.
- Läuft von der RTX 3090 bis zum ausgemusterten Büro-PC von 2017.
- Rund 9 % Wortfehler auf vorgelesenem Deutsch, unabhängig von der Maschine.
- Auf Telefonqualität steigt die Fehlerrate auf das Zwei- bis Dreifache.
- Sprechertrennung und Zeitmarken liefert es nicht selbst — dafür braucht es WhisperX obendrauf.
- Eigennamen und Ortsnamen verunglücken zuverlässig; das trifft im Bodenseeraum oft.
Wo wir es einsetzen
- memoro — Sprachnotizen verschriftlichen (über den Dienst auf der GPU-Box).
- Der Ausweichweg auf einem Büro-PC, wenn die Grafikkarte ausfällt.
Wie schnell und wie genau dieses Modell auf unseren drei Maschinen arbeitet — und warum die Grafikkarte trotz 247 Watt weniger Strom je Stunde Aufnahme braucht als ein 37-Watt-Büro-PC — steht im Vergleich Alle Maschinen, dieselbe Aufgabe. Dass die Laufzeitumgebung dabei mehr ausmacht als die Modellwahl, ist gesondert nachgemessen: Spracherkennung auf einem zehn Jahre alten Büro-PC.
Quellen Dritter
Weitere Steckbriefe
-
lokal (eigene GPU)Gemma 4 12B
-
lokal (eigene GPU)Qwen3-TTS 1.7B
-
lokal (eigene GPU)FLUX.2 [klein] 4B
-
lokal (eigene GPU)ACE-Step
-
lokal (eigene GPU)MusicGen
-
on-deviceQwen2.5 0.5B
-
lokal (eigene GPU)TRELLIS
-
lokal (eigene GPU)HTDemucs v4
-
lokal (eigene GPU)Pixtral 12B
-
lokal (eigene GPU)Ideogram 4.0
-
lokal (eigene GPU)SenseNova U1.5 8B-MoT
-
lokal (eigene GPU)Qwen-Image-Edit 2511
-
ChinaMiniMax H3
-
ChinaMiniMax Music 3
Ein Steckbrief sagt, was ein Modell ist. Welches Modell eine konkrete Aufgabe gewinnt, entscheiden wir nicht aus dem Bauch, sondern messen es — Qualität gegen Kosten, pro Operation.