faster-whisper
SYSTRAN
Redaktionelle Einschätzung auf Basis öffentlich zugänglicher Quellen (Anbieterangaben, Preislisten, unabhängige Bewertungsplattformen), kein Hands-on-Produkttest, sofern nicht ausdrücklich anders angegeben. Die Sternebewertung ist eine Meinung der Redaktion.
Tool öffnenfaster-whisper ist die schnellere Neuimplementierung von OpenAIs Whisper: gleiche Modelle, laut Projekt bis zu viermal schneller, lokal und kostenlos. Die Bibliothek nutzt die Inferenz-Engine CTranslate2, spart durch int8-Quantisierung deutlich Arbeitsspeicher und macht Transkription damit auch auf Rechnern ohne Grafikkarte praktikabel.
Kosten: Vollständig kostenlos unter MIT-Lizenz, auch kommerziell. Kein Anbieter, keine Tarife, keine Registrierung. Die einzigen Kosten sind eigene Hardware und Einrichtungszeit.
Kategorien
Stärken
- Laut Projekt bis zu viermal schneller als openai/whisper bei gleicher Genauigkeit
- Deutlich geringerer Speicherbedarf durch int8-Quantisierung, small braucht 1.477 statt 2.257 MB RAM
- MIT-Lizenz für Code und konvertierte Modelle, kommerzielle Nutzung ohne Lizenzkosten
- Läuft ohne separate FFmpeg-Installation, PyAV bringt die Audio-Bibliotheken mit
- Unterstützt large-v3, turbo und das englischsprachige distil-large-v3, Modelle werden beim ersten Start automatisch geladen
- Batch-Verarbeitung, VAD-Filter gegen Stille und Zeitstempel auf Wortebene sind eingebaut
Einschränkungen
- Reine Python-Bibliothek ohne Oberfläche, Einrichtung nur über die Kommandozeile
- GPU-Beschleunigung ausschließlich auf NVIDIA-Karten, Apple Silicon läuft nur über die CPU
- cuBLAS für CUDA 12 und cuDNN 9 müssen separat installiert werden, eine häufige Fehlerquelle
- Keine Sprechertrennung (Diarisierung) an Bord, muss extra angebaut werden
- Erbt Whispers Neigung zu Halluzinationen bei Stille und schlechtem Audio
- Letzter Push im Repository am 19. November 2025, das Entwicklungstempo hat nachgelassen
Passt gut zu
Wann ja, wann nein
Wann ja
- Whisper läuft bei dir, ist aber zu langsam oder sprengt den Arbeitsspeicher
- Du transkribierst regelmäßig größere Mengen Audio auf eigener Hardware
- Deine Aufnahmen dürfen den Rechner oder das Firmennetz nicht verlassen
- Du baust Transkription als Funktion in eine eigene Anwendung ein
Wann nein
- Du willst eine fertige App mit Oberfläche, Export und Teilen-Funktion
- Du brauchst automatische Sprechertrennung ohne eigenen Bastelaufwand
- Niemand im Team arbeitet mit Python und Kommandozeile
- Du brauchst Live-Transkription in laufenden Videokonferenzen
Kurzfazit
faster-whisper ist dieselbe Spracherkennung wie OpenAIs Whisper, nur schneller: die Neuimplementierung von SYSTRAN nutzt CTranslate2 und ist laut Projekt bis zu viermal schneller bei gleicher Genauigkeit. Im Benchmark der Entwickler braucht das small-Modell auf einer CPU 1 Minute 42 statt 6 Minuten 58 für 13 Minuten Audio, bei 1.477 statt 2.335 MB Arbeitsspeicher. MIT-Lizenz, keine Lizenzkosten. Der Preis: Python, Kommandozeile, und GPU-Beschleunigung nur auf NVIDIA-Karten.
Für wen ist faster-whisper?
Alle, denen Whisper zu langsam ist: Das ist der Hauptgrund, hierher zu wechseln. Wenn in unserem Tutorial Dein erstes Transkript mit Whisper das Kommando auf deinem Rechner ewig läuft, ist faster-whisper der Ausweg, ohne dass du Qualität aufgibst oder eine Modellgröße heruntergehen musst. Es sind dieselben Modellgewichte, nur anders ausgeführt.
Entwickler, die Transkription einbauen: faster-whisper ist eine Python-Bibliothek, kein Programm. Wer Transkription als Baustein in eine eigene Anwendung, eine Verarbeitungsstrecke oder einen internen Dienst einzieht, bekommt hier eine schlanke Abhängigkeit mit sauberer API, Zeitstempeln auf Wortebene und Batch-Verarbeitung.
Redaktionen, Podcast- und Medienproduktion: Wer Woche für Woche Stunden an Rohmaterial durchschleusen muss, rechnet in Verarbeitungszeit. Ein Faktor vier auf derselben Hardware entscheidet darüber, ob die Transkription über Nacht läuft oder in der Mittagspause fertig ist.
Kanzleien, Praxen, Marktforschung, Personalabteilungen: Überall dort, wo Aufnahmen vertraulich sind, ist lokale Verarbeitung kein Komfortthema, sondern Voraussetzung. faster-whisper läuft vollständig offline, sobald das Modell einmal heruntergeladen ist.
Betreiber älterer Hardware: Die int8-Quantisierung ist der eigentliche Trick. Sie senkt Rechenzeit und Speicherbedarf gleichzeitig, was Transkription auf Bürorechnern ohne Grafikkarte überhaupt erst erträglich macht.
Weniger geeignet für: Teams ohne technische Besetzung, Nutzer, die eine Oberfläche mit Konto, Export und Freigabelink erwarten, Mac-Nutzer, die auf GPU-Beschleunigung hoffen (die gibt es hier nur auf NVIDIA), und alle, die Sprechertrennung fertig eingebaut brauchen.
Preise im Detail
| Posten | Kosten | Was du dafür bekommst |
|---|---|---|
| Software (MIT-Lizenz) | 0 € | Vollständiger Quellcode, kommerzielle Nutzung erlaubt, keine Registrierung, kein Konto |
| Modellgewichte über Hugging Face | 0 € | large-v3, turbo, das englischsprachige distil-large-v3 und alle kleineren Größen, automatischer Download beim ersten Start |
| Betrieb auf vorhandener CPU | 0 € zusätzlich | small mit int8: 13 Minuten Audio in 1 Minute 42, 1.477 MB RAM (Intel i7-12700K, 8 Threads) |
| Betrieb auf eigener NVIDIA-GPU | Hardware und Strom | large-v2 mit int8: 13 Minuten Audio in 59 Sekunden, 2.926 MB VRAM (RTX 3070 Ti) |
| Support | nicht käuflich | GitHub-Issues auf Englisch, kein Anbieter-Support, kein Vertrag |
Einordnung: Es gibt hier nichts zu kaufen. faster-whisper hat keinen Anbieter im üblichen Sinn, keine Tarifstufen, keine Nutzungsgrenzen und keine Zahlungsschranke. SYSTRAN stellt die Bibliothek unter MIT-Lizenz bereit, die konvertierten Modelle liegen ebenfalls unter MIT auf Hugging Face. Die aktuelle Version 1.2.1 stammt vom 31. Oktober 2025. Deine echten Kosten sind Einrichtungszeit (rechne mit einem halben bis einem Tag, wenn CUDA und cuDNN neu aufgesetzt werden müssen) und Rechenleistung. Was eine gemietete GPU-Instanz bei Cloud-Anbietern kostet, haben wir nicht geprüft und nennen deshalb keine Zahl. Zum Vergleich: kommerzielle Transkriptionsdienste rechnen pro Audiominute ab, hier zahlst du einmal Hardware und danach nichts mehr.
Stärken im Detail
Der Geschwindigkeitsgewinn ist gemessen, nicht behauptet. Das Projekt veröffentlicht seine Benchmarks samt Hardware, Modell und Rechentyp. Für 13 Minuten Audio mit large-v2 auf einer NVIDIA RTX 3070 Ti (fp16, beam=5) braucht openai/whisper 2 Minuten 23 bei 4.708 MB VRAM, faster-whisper 1 Minute 3 bei 4.525 MB. Mit int8 sind es 59 Sekunden bei 2.926 MB. Auf der CPU ist der Abstand noch deutlicher: small mit fp32 kommt bei openai/whisper auf 6 Minuten 58, faster-whisper schafft dasselbe in 2 Minuten 37 und mit int8 in 1 Minute 42. Das ist der Unterschied zwischen Feierabend und Warteschleife.
Gleiche Modelle, gleiche Deutsch-Qualität. faster-whisper trainiert nichts neu. Die Gewichte werden aus den Original-Modellen ins CTranslate2-Format konvertiert, Systran/faster-whisper-large-v3 etwa direkt aus openai/whisper-large-v3 mit float16-Gewichten. Was für Whisper auf Deutsch gilt, gilt hier genauso: saubere Zeichensetzung, brauchbare Groß- und Kleinschreibung, solide Ergebnisse auch bei Akzent und Fachvokabular. Bei Eigennamen und Abkürzungen hilft derselbe Kniff mit initial_prompt.
int8 spart Speicher, ohne die Qualität zu ruinieren. CTranslate2 quantisiert die Gewichte in Embedding- und Linear-Schichten symmetrisch, nicht quantisierte Schichten laufen in der ursprünglichen Fließkomma-Genauigkeit weiter. Die Dokumentation beschreibt das als Verfahren mit geringem bis keinem Genauigkeitsverlust. Praktisch heißt das: ein größeres Modell passt auf dieselbe Karte, und auf der CPU sinkt der Speicherbedarf spürbar, im Benchmark von 2.257 auf 1.477 MB.
Der Rechentyp passt sich der Hardware an. Verfügbar sind int8, int8_float16, int8_bfloat16, int16, float16, bfloat16 und float32. float16 setzt eine NVIDIA-GPU ab Compute Capability 7.0 voraus, bfloat16 ab 8.0, int16 läuft nur mit dem Intel-MKL-Backend. Wer sich damit nicht befassen will, lässt compute_type="auto" stehen, dann wird der schnellste unterstützte Typ gewählt. Auf x86-64 entscheiden die fertigen Pakete zusätzlich automatisch zwischen AVX, AVX2 und AVX512.
Weniger Installationsbaustellen als beim Original. FFmpeg muss nicht separat installiert werden, PyAV bringt die nötigen Bibliotheken mit. Genau daran scheitern beim Original-Whisper viele Erstversuche unter Windows. Für den reinen CPU-Betrieb reichen Python 3.9 oder neuer und ein pip install faster-whisper.
Funktionen, die beim Original fehlen. Batch-Verarbeitung mit einstellbarer Stapelgröße, ein VAD-Filter, der Stille vor der Erkennung wegschneidet (im Batch-Modus standardmäßig aktiv), und Zeitstempel auf Wortebene sind eingebaut. Der VAD-Filter dämpft nebenbei das bekannteste Whisper-Ärgernis, erfundenen Text in langen Pausen.
Schwächen ehrlich betrachtet
GPU-Beschleunigung gibt es nur bei NVIDIA. CTranslate2 listet als GPU-Plattform ausschließlich NVIDIA-Karten ab Compute Capability 3.5. AMD-Karten und die Grafikeinheit in Apple-Silicon-Macs bleiben ungenutzt. Auf einem MacBook läuft faster-whisper über den ARM64-CPU-Pfad. Ein Tempovorteil gegenüber dem Original ist dort zu erwarten, belegt ist er nicht: die veröffentlichten Benchmarks laufen alle auf x86-Hardware, für ARM64 nennt das Projekt keine Zahlen. Wer auf dem Mac das Maximum an Tempo will, ist mit whisper.cpp besser bedient, das die Apple-Hardware direkt anspricht. Workaround in der Zwischenzeit: eine Modellgröße kleiner wählen oder konsequent int8 nutzen.
CUDA und cuDNN sind die klassische Stolperstelle. Für GPU-Betrieb braucht es cuBLAS für CUDA 12 und cuDNN 9 für CUDA 12. Passt eine Version nicht, bricht der Start mit einer Fehlermeldung ab, die den eigentlichen Grund nicht nennt. Ein guter Teil der offenen Issues im Repository dreht sich genau darum. Workaround: ein fertiges Container-Image mit passenden Bibliotheken nutzen, statt alles von Hand zu installieren.
Keine Oberfläche, keine Anwendung. faster-whisper ist eine Bibliothek. Es gibt keine Fenster, keine Schaltflächen, keinen Fortschrittsbalken für Kolleginnen und Kollegen ohne Terminal-Erfahrung. Drittprojekte setzen Oberflächen und Server-Schnittstellen darauf, die sind aber nicht Teil des Projekts und werden hier auch nicht mitgepflegt.
Sprechertrennung fehlt. Wer wissen will, wer wann gesprochen hat, etwa bei Interviews mit mehreren Teilnehmenden oder bei Sitzungsprotokollen, muss Diarisierung separat anbauen. Das ist eigene Integrationsarbeit und die häufigste Enttäuschung beim ersten Einsatz.
Halluzinationen bleiben. Der Geschwindigkeitsvorteil kommt aus der Ausführung, nicht aus einem besseren Modell. Die Neigung, in Stille oder bei stark verrauschtem Audio Text zu erfinden, erbt faster-whisper unverändert. Der VAD-Filter hilft, beseitigt das Problem aber nicht. Bei rechtlich oder redaktionell heiklen Transkripten bleibt Gegenlesen Pflicht.
Das Projekt wird langsamer. 25.145 Sterne und 2.048 Forks zeigen die Verbreitung, aber der letzte Push liegt (Stand 30. August 2026) auf dem 19. November 2025, die letzte Version 1.2.1 auf dem 31. Oktober 2025, und 319 Issues sind offen. Archiviert ist das Repository nicht, kaputt ist auch nichts, die Bibliothek läuft stabil. Wer aber auf zügige Unterstützung für neue Whisper-Modelle hofft, sollte sich darauf nicht verlassen.
Alternativen im Vergleich
| Wenn du… | …nimm stattdessen |
|---|---|
| das Original mit der größten Sammlung an Anleitungen und Beispielen willst | Whisper |
| gar nichts installieren willst und pro Minute abrechnen kannst | Deepgram |
| Transkription mit Oberfläche brauchst, ohne eigene Hardware | HappyScribe |
| Podcast und Video in einem Werkzeug schneiden und transkribieren willst | Descript |
| Meetings automatisch mitschreiben lassen willst, ohne Einrichtung | Otter.ai |
Auf Apple-Silicon-Macs ist whisper.cpp die naheliegende Alternative: dieselbe Idee, andere Umsetzung, dafür Nutzung der Apple-Hardware. Im Benchmark des Projekts liegt whisper.cpp auf der CPU mit 2 Minuten 5 sogar knapp vor faster-whisper mit fp32 (2 Minuten 37), verliert aber gegen int8 (1 Minute 42). Eine eigene Seite haben wir dazu bisher nicht.
So steigst du ein
Schritt 1: Installieren und einmal laufen lassen. pip install faster-whisper in einer virtuellen Umgebung, Python 3.9 oder neuer. FFmpeg brauchst du nicht separat. Nimm für den ersten Versuch dieselbe Aufnahme, mit der du Whisper ausprobiert hast, dann siehst du den Unterschied unmittelbar, statt ihn glauben zu müssen.
Schritt 2: Modell und Rechentyp festlegen. In Python lädst du das Modell einmal (WhisperModel("large-v3", device="cpu", compute_type="int8")) und verarbeitest danach Dateien in der Schleife. Ohne Grafikkarte ist int8 fast immer die richtige Wahl, mit NVIDIA-Karte float16 oder ebenfalls int8. Wenn du dich nicht entscheiden willst, nimm compute_type="auto". Setz die Sprache mit language="de" fest, das spart die Spracherkennung und verhindert Ausrutscher bei kurzen Aufnahmen.
Schritt 3: Für den Dauerbetrieb sauber aufsetzen. Aktiviere den VAD-Filter gegen erfundenen Text in Pausen, schalte auf Batch-Verarbeitung, wenn viele Dateien anstehen, und lege den Modell-Cache in ein Verzeichnis, das nicht bei jedem Neuaufbau verschwindet. Für GPU-Betrieb nimm ein Container-Image mit passendem CUDA 12 und cuDNN 9, statt die Bibliotheken auf dem Arbeitsrechner von Hand zusammenzusuchen. Wenn Sprechertrennung gebraucht wird, plane sie von Anfang an als eigenen Schritt ein.
Ein konkretes Beispiel
Eine Bremer Podcast-Produktion mit vier laufenden Formaten schleust pro Woche rund zwölf Stunden Rohmaterial durch. Bisher lief das Original-Whisper mit medium nachts auf einem älteren Bürorechner ohne Grafikkarte, ein Durchlauf brauchte den kompletten Abend, und Korrekturschleifen am nächsten Tag waren nicht drin. Nach dem Umstieg auf faster-whisper mit int8 läuft derselbe Stapel auf derselben Maschine in einem Bruchteil der Zeit, das Team startet die Transkription jetzt direkt nach der Aufnahme und liest noch am selben Nachmittag gegen. Umgestellt wurde an einem Vormittag, es waren im Wesentlichen zwei geänderte Zeilen im vorhandenen Skript. Kosten: null, es fiel kein Abo an und es wurde keine Hardware gekauft. Die Aufnahmen mit Gästen bleiben weiterhin im Haus, was die Produktion in ihren Gastvereinbarungen ausdrücklich zusichert.
DSGVO & Datenschutz
- Verarbeitung vollständig lokal: Audio wird auf deiner eigenen Hardware verarbeitet. Es gibt keinen Anbieter-Server, keine Cloud-Übertragung und keinen Dritten, der Aufnahmen zu sehen bekommt. Damit findet aus Datenschutzsicht keine Übermittlung statt.
- Einmaliger Modell-Download: Beim ersten Start lädt die Bibliothek das passende Modell vom Hugging Face Hub, einem US-Dienst. Dabei fließen technische Verbindungsdaten, aber keine Audioinhalte. Danach läuft alles offline, in abgeschotteten Umgebungen kann das Modell vorab manuell hinterlegt werden.
- Kein Auftragsverarbeitungsvertrag nötig: Ohne Auftragsverarbeiter gibt es nichts zu vereinbaren. Das ist der praktische Vorteil gegenüber jedem Cloud-Transkriptionsdienst, für den ein AVV und eine Prüfung der Drittlandübermittlung fällig wären.
- Kein Training mit deinen Daten: Es existiert keine Rückmeldeschleife zu einem Anbieter. Die Modelle sind statisch, deine Aufnahmen verändern sie nicht.
- Deine Pflichten bleiben trotzdem: Verzeichnis der Verarbeitungstätigkeiten, Löschfristen für Aufnahmen und Transkripte, Zugriffsrechte auf dem Server und die Einwilligung der aufgenommenen Personen musst du weiterhin selbst regeln. Lokale Verarbeitung entbindet nicht von der Rechtsgrundlage.
- Empfehlung für sensible Bereiche: Für Kanzleien, Praxen, Betriebsräte und Personalabteilungen ist der Betrieb auf einem internen Server ohne Internetzugang die sauberste Variante. Der Aufwand ist überschaubar, das Ergebnis rechtlich deutlich ruhiger als jede Cloud-Lösung.
Gut kombiniert mit
- Whisper als Referenz und Einstieg: Erst mit dem Original ein Gefühl für Modellgrößen, Sprachauswahl und
initial_promptbekommen, dann für den Dauerbetrieb auf faster-whisper wechseln. Die Optionen heißen weitgehend gleich, das Wissen überträgt sich eins zu eins. - Ollama für die Weiterverarbeitung auf demselben Rechner: Transkript aus faster-whisper direkt an ein lokales Sprachmodell geben und daraus Zusammenfassung, Themenliste oder Protokollentwurf erzeugen. Die Kette bleibt vollständig offline, damit hält der Datenschutzvorteil bis zum Ergebnis.
- n8n als Klammer für die Automatisierung: Eine neue Datei in einem überwachten Ordner löst die Transkription aus, das fertige Transkript landet in Ablage oder Redaktionssystem und das Team bekommt eine Nachricht. n8n lässt sich selbst hosten, damit verlässt auch hier nichts das eigene Netz.
Häufige Fragen zu faster-whisper
Ist faster-whisper genauer als Whisper? Nein, die Genauigkeit ist dieselbe. Es sind exakt die Modelle von OpenAI, nur ins CTranslate2-Format konvertiert. Das Projekt spricht von bis zu viermal höherer Geschwindigkeit bei gleicher Genauigkeit. Der Unterschied liegt in der Ausführung, nicht im Modell.
Brauche ich eine Grafikkarte? Nein. Genau das ist der Punkt: Auf der CPU verarbeitet faster-whisper mit int8 im Benchmark 13 Minuten Audio mit dem small-Modell in 1 Minute 42, das Original braucht dafür 6 Minuten 58. Eine NVIDIA-Karte beschleunigt zusätzlich deutlich, ist aber keine Voraussetzung.
Läuft faster-whisper auf einem Mac mit Apple Silicon?
Ja, über den ARM64-CPU-Pfad. Die Grafikeinheit des Macs wird allerdings nicht genutzt, CTranslate2 unterstützt als GPU nur NVIDIA-Karten. Auf Apple-Hardware ist whisper.cpp deshalb häufig die schnellere Wahl.
Ist faster-whisper wirklich kostenlos, auch für Firmen? Ja. Code und konvertierte Modelle stehen unter MIT-Lizenz, das erlaubt kommerzielle Nutzung ohne Gebühren und ohne Registrierung. Es gibt keine Nutzungsgrenzen und keinen Anbieter, der abrechnet. Support gibt es dafür allerdings auch keinen, nur GitHub-Issues auf Englisch.
Kann faster-whisper Sprecher auseinanderhalten? Nein, Diarisierung ist nicht eingebaut. Zeitstempel gibt es bis auf Wortebene, die Zuordnung, wer gerade spricht, musst du über ein zusätzliches Verfahren ergänzen. Wenn das zentral für dich ist, ist ein fertiger Dienst wie HappyScribe der schnellere Weg.
Unser Fazit
faster-whisper bekommt 4 von 5 Sternen. Es macht genau eine Sache und die richtig gut: Whisper schneller und sparsamer ausführen, ohne an der Qualität zu drehen. Für alle, die schon lokal transkribieren, ist der Wechsel eine der günstigsten Verbesserungen überhaupt, zwei Zeilen Code für einen Faktor von zwei bis vier. Den fünften Stern kosten drei Dinge: die fehlende Oberfläche, GPU-Beschleunigung ausschließlich auf NVIDIA-Karten, was für Mac-Nutzer ärgerlich ist, und ein Projekt, das seit Ende 2025 sichtbar langsamer wird. Wer eine fertige Anwendung sucht, ist hier falsch. Wer Whisper bereits nutzt und auf den Fortschrittsbalken starrt, sollte heute wechseln.
Was wir bemerkt haben
- Februar 2023, das Repository wurde angelegt und hat sich seither zum Standardweg entwickelt, Whisper produktiv zu betreiben: 25.145 Sterne und 2.048 Forks (Stand 30. August 2026).
- Distil-Modelle, das destillierte distil-large-v3 ist laut Modellkarte auf OpenAIs sequenziellen Long-Form-Algorithmus ausgelegt, den Whisper.cpp, faster-whisper und OpenAI Whisper gemeinsam nutzen. Es lässt sich in faster-whisper laden wie jedes andere Modell und kommt mit 756 statt 1.550 Millionen Parametern auf die 6,3-fache Geschwindigkeit von large-v3. Der Haken für uns: Distil-Whisper ist eine rein englischsprachige Modellreihe. Für deutsche Aufnahmen bleiben large-v3 und turbo.
- Oktober 2025, Version 1.2.1 erschien am 31. Oktober 2025 und setzt CTranslate2 in Version 4 voraus.
- November 2025, seitdem ist im Repository nichts mehr passiert: Der letzte Push datiert auf den 19. November 2025, 319 Issues sind offen. Archiviert ist es nicht, und die Bibliothek funktioniert unverändert, aber das Entwicklungstempo hat deutlich nachgelassen. Wer neue Whisper-Modelle zeitnah nutzen will, sollte das im Blick behalten.
- Laufend, nur NVIDIA-GPUs werden beschleunigt. Trotz der wachsenden Zahl an Apple-Silicon-Rechnern gibt es keine Metal-Unterstützung, hier bleibt whisper.cpp die Antwort.
Quellen
- SYSTRAN faster-whisper, GitHub-Repository (README). https://github.com/SYSTRAN/faster-whisper (abgerufen am 2026-08-30). MIT-Lizenz; bis zu viermal schneller als openai/whisper bei gleicher Genauigkeit; Benchmarks large-v2 auf RTX 3070 Ti und small auf Intel i7-12700K; Python 3.9 oder neuer; cuBLAS für CUDA 12 und cuDNN 9 für GPU-Betrieb; PyAV statt separater FFmpeg-Installation; Batch-Verarbeitung, VAD-Filter, Zeitstempel auf Wortebene; Kompatibilität mit distil-large-v3.
- GitHub API, Repository-Metadaten SYSTRAN/faster-whisper. https://api.github.com/repos/SYSTRAN/faster-whisper (abgerufen am 2026-08-30). 25.145 Sterne, 2.048 Forks, 319 offene Issues, Lizenz MIT, Repository angelegt am 11. Februar 2023, letzter Push am 19. November 2025, nicht archiviert.
- PyPI, faster-whisper Paketmetadaten. https://pypi.org/pypi/faster-whisper/json (abgerufen am 2026-08-30). Aktuelle Version 1.2.1 vom 31. Oktober 2025, MIT-Lizenz, Python ab 3.9, Abhängigkeit ctranslate2 ab 4.0 und unter 5.
- CTranslate2, Hardware Support. https://opennmt.net/CTranslate2/hardware_support.html (abgerufen am 2026-08-30). x86-64 ab SSE 4.1 und AArch64/ARM64 als CPU-Plattformen, NVIDIA-GPUs ab Compute Capability 3.5, Intel MKL auf Intel-Prozessoren und oneDNN auf anderen x86-64-CPUs, automatische Auswahl von AVX, AVX2 oder AVX512.
- CTranslate2, Quantization. https://opennmt.net/CTranslate2/quantization.html (abgerufen am 2026-08-30). Rechentypen int8, int8_float16, int8_bfloat16, int16, float16, bfloat16 und float32 samt Hardware-Voraussetzungen; float16 ab Compute Capability 7.0, bfloat16 ab 8.0, int16 nur mit Intel MKL; auto wählt den schnellsten unterstützten Typ; Quantisierung mit geringem bis keinem Genauigkeitsverlust.
- Hugging Face, Systran/faster-whisper-large-v3. https://huggingface.co/Systran/faster-whisper-large-v3 (abgerufen am 2026-08-30). Konvertierung von openai/whisper-large-v3 ins CTranslate2-Format mit float16-Gewichten, MIT-Lizenz, Rechentyp beim Laden über compute_type änderbar.
- Hugging Face, distil-whisper/distil-large-v3 (Modellkarte). https://huggingface.co/distil-whisper/distil-large-v3 (abgerufen am 2026-08-30). Ausrichtung auf OpenAIs sequenziellen Long-Form-Algorithmus, den laut Modellkarte Whisper.cpp, Faster-Whisper und OpenAI Whisper gemeinsam nutzen; 756 statt 1.550 Millionen Parameter gegenüber large-v3; relative Geschwindigkeit 6,3 gegenüber large-v3; englischsprachige Modellreihe, gedacht als Ersatz für large-v3 bei englischer Spracherkennung.
Diesen Inhalt teilen:
Arthur Atlas
KI-Analyst
So entsteht diese Bewertung
Diese Seite bewerten wir redaktionell, mit kräftiger Unterstützung von Arthur Atlas, unserem KI-Analysten. Er prüft Bewertungen nach und markiert veraltete Angaben, sobald sich der Markt dreht. Unsere Angaben stammen überwiegend aus öffentlich zugänglichen Quellen wie Anbieter-Website, Doku und Preislisten. Preise und Funktionen können sich ändern.
Hinweis: Diese Angaben können veraltet oder fehlerhaft sein. Prüfe im Zweifel immer direkt auf der Website des Anbieters.
Preise geändert, Feature veraltet oder etwas fehlt?
Wir freuen uns über Hinweise und Ergänzungen.
Du arbeitest bei SYSTRAN?
Gib uns einen Testzugang, dann schauen wir tiefer rein und ergänzen die Bewertung aus erster Hand.
Nicht sicher, ob faster-whisper zu euch passt?
Wir helfen bei der Tool-Auswahl und begleiten die Einführung in euren Arbeitsalltag, unverbindlich und kostenlos im Erstgespräch.
KI-Tools und Trends
KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools
Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.