Whisper ist OpenAIs Spracherkennungsmodell, Code und Modellgewichte stehen unter MIT-Lizenz. Es läuft auf deinem eigenen Rechner: kein Konto, keine Kreditkarte, 0 Euro. Du nimmst zwei Minuten Sprache auf, startest ein einziges Kommando im Terminal und hast nach 15 Minuten ein Transkript als .txt und eine Untertiteldatei als .srt. Deine Aufnahme verlässt dabei nie deinen Rechner, deshalb taugt der Weg auch für Interviews, Personalgespräche und Vorlesungen.
Stufe 1: Anfänger, Dein erstes Transkript in 15 Minuten
Der Weg führt über das Terminal. Es gibt auch grafische Oberflächen für Whisper, hier bleibt es beim Kommando: Damit steuerst du Modellgröße, Sprache und Ausgabeordner direkt. Die 15 Minuten gelten für einen Rechner, auf dem schon ein Paketmanager läuft (Homebrew, winget oder Chocolatey, apt). Fehlt der, rechne dessen Installation obendrauf.
Schritt 1: Zwei Minuten Sprache aufnehmen
Nimm mit der Sprachmemo-App deines Handys oder deines Rechners zwei Minuten auf. Erzähl, was du diese Woche vorhast, lies eine Zeitungsseite vor, halte ein kurzes Selbstgespräch über ein Projekt. Der Inhalt ist egal, die Länge ist wichtig: zwei Minuten laufen auch auf einem älteren Rechner schnell durch.
Leg die Datei in einen eigenen Ordner, zum Beispiel Dokumente/transkription, und benenne sie aufnahme.m4a. Whisper frisst so gut wie jedes Format: m4a, mp3, wav, flac, und auch die Tonspur aus mp4-Videos.
Schritt 2: Voraussetzungen installieren
Du brauchst zwei Dinge: Python und ffmpeg. Öffne das Terminal (macOS: Spotlight, „Terminal”; Windows: PowerShell) und prüf zuerst Python:
python3 --version
Kommt eine Versionsnummer ab 3.8 zurück, bist du fertig. Sonst hol dir Python von python.org.
Dann ffmpeg, das Whisper zum Einlesen der Audiodatei braucht:
# macOS, mit Homebrew: https://brew.sh/
brew install ffmpeg
# Windows, mit winget (bei Windows 11 an Bord)
winget install Gyan.FFmpeg
# Windows, mit Chocolatey: https://chocolatey.org/install
# PowerShell dafür als Administrator öffnen
choco install ffmpeg
# Ubuntu / Debian
sudo apt update && sudo apt install ffmpeg
Und zuletzt Whisper selbst. Nutz python3 -m pip, dann landet das Paket sicher bei genau dem Python, das du eben geprüft hast:
python3 -m pip install -U openai-whisper
Das dauert ein paar Minuten, weil PyTorch mitkommt. Ein Konto legst du nirgends an.
Bricht die Installation mit error: externally-managed-environment ab, schützt dein System sein eigenes Python (üblich bei Homebrew-Python, Debian ab 12 und Ubuntu ab 23.04). Dann arbeitest du in einer eigenen Umgebung:
python3 -m venv ~/whisper-env
source ~/whisper-env/bin/activate # Windows: ~\whisper-env\Scripts\Activate.ps1
python3 -m pip install -U openai-whisper
Die Umgebung aktivierst du in jedem neuen Terminal einmal, bevor du Whisper startest.
Schritt 3: Das eine Kommando
Wechsel im Terminal in deinen Ordner und starte:
whisper aufnahme.m4a --model small --language German --output_dir transkript
Was dabei passiert: Whisper lädt beim allerersten Lauf das Modell small herunter, das ist der Teil, der Zeit kostet. Danach liegt es lokal und wird nie wieder geladen. Anschließend zerlegt Whisper deine Aufnahme in Abschnitte, erkennt die Sprache und schreibt die Ergebnisse als Dateien in den Ordner transkript.
Die drei Angaben sind bewusst gesetzt. --model small ist der beste Kompromiss aus Qualität und Wartezeit für den ersten Lauf. --language German spart die automatische Spracherkennung und verhindert, dass ein deutsches Gespräch als Niederländisch erkannt wird. --output_dir hält deinen Ordner sauber.
Schritt 4: Dein Ergebnis öffnen
Im Ordner transkript liegen jetzt mehrere Dateien mit dem Namen deiner Aufnahme. Whisper schreibt standardmäßig alle Formate auf einmal:
| Datei | Was drinsteht | Wofür |
|---|---|---|
.txt | reiner Fließtext ohne Zeiten | Lesen, weiterverarbeiten |
.srt | Textblöcke mit Zeitmarken | Untertitel für Video |
.vtt | Untertitel im Web-Format | HTML5-Video, YouTube |
.tsv | Zeiten und Text tabellarisch | Tabellenkalkulation |
.json | alle Segmente mit Metadaten | eigene Skripte |
Öffne die .txt. Das ist dein erstes Transkript, erzeugt komplett offline. Brauchst du nur ein Format, häng --output_format txt ans Kommando.
Stufe 2: Fortgeschritten, Qualität steuern
Modellgrößen gegen Rechenzeit
Whisper gibt es in sechs Größen. Die Zahlen stammen aus der offiziellen Modelltabelle des Projekts (github.com/openai/whisper, abgerufen am 30. August 2026):
| Modell | Parameter | Speicherbedarf | Relative Geschwindigkeit |
|---|---|---|---|
| tiny | 39 Mio. | ~1 GB | ~10x |
| base | 74 Mio. | ~1 GB | ~7x |
| small | 244 Mio. | ~2 GB | ~4x |
| medium | 769 Mio. | ~5 GB | ~2x |
| turbo | 809 Mio. | ~6 GB | ~8x |
| large | 1.550 Mio. | ~10 GB | 1x |
Der Speicherbedarf bezieht sich auf Grafikspeicher. Ohne dedizierte Grafikkarte läuft alles über Prozessor und Arbeitsspeicher, dann ist es deutlich langsamer. Wichtig zur letzten Spalte: Die relative Geschwindigkeit ist laut Projektseite auf einer A100-Grafikkarte mit englischer Sprache gemessen. Auf einem Rechner ohne Grafikkarte gelten diese Verhältnisse nicht, dort schlägt vor allem die Zahl der Parameter durch.
Nimm eine Minute Audio und lass sie durch tiny, small und turbo laufen. Bei sauber gesprochenem Deutsch wirst du zwischen small und turbo wenig Unterschied hören, bei Nebengeräuschen, Dialekt oder mehreren Sprechenden dagegen viel. turbo ist die interessante Größe: laut Tabelle sogar etwas schneller als base, bei zehnmal so vielen Parametern. Auf einem Rechner ohne Grafikkarte gilt dieser Vorsprung allerdings nicht, dort ist turbo spürbar langsamer als die kleinen Modelle. Für Übersetzung ist es laut Projektseite nicht trainiert und gibt bei --task translate die Originalsprache zurück.
Sprache erzwingen
Ohne --language rät Whisper anhand der ersten Sekunden. Bei Musik am Anfang, einer englischen Begrüßung oder leiser Aufnahme geht das schief, und dann bekommst du ein deutsches Gespräch in ausgedachtem Englisch zurück. Setz --language German immer, wenn du weißt, was gesprochen wird.
Die häufigsten Fehler
- „ffmpeg not found”: ffmpeg fehlt oder ist nicht im Suchpfad. Nach der Installation das Terminal einmal komplett schließen und neu öffnen, dann
ffmpeg -versionprüfen. - „whisper: command not found”: Das Paket ist installiert, aber das Verzeichnis mit dem Startskript liegt nicht im Suchpfad. Arbeite in der virtuellen Umgebung aus Stufe 1, oder ruf Whisper direkt über Python auf:
python3 -m whisper aufnahme.m4a --model small --language German. - Modell-Download bricht ab: Whisper legt Modelle unter
~/.cache/whisperab und prüft dort die Prüfsumme. Eine unvollständige Datei lädt es beim nächsten Lauf automatisch neu, du startest das Kommando also einfach noch einmal. - Sehr langsame Verarbeitung: Auf älteren Rechnern ohne Grafikkarte kann eine Stunde Audio mit
mediumoderlargemehrere Stunden dauern. Geh eine Modellgröße runter, oder wechsel auffaster-whisperbeziehungsweisewhisper.cpp. Beides sind eigenständige Neuimplementierungen desselben Modells, die auf Prozessoren deutlich schneller laufen.
Fachbegriffe und Eigennamen
Am häufigsten falsch sind genau die Wörter, die in normalem gesprochenem Deutsch selten vorkommen: Produktnamen, Abkürzungen, Nachnamen, Fachvokabular. Whisper sagt jeweils das nächste wahrscheinliche Wort voraus, und ein seltener Eigenname ist per Definition unwahrscheinlicher als ein alltägliches Wort, das ähnlich klingt.
Dagegen hilft --initial_prompt. Du gibst Whisper einen kurzen Text mit, der die erwarteten Begriffe in korrekter Schreibweise enthält:
whisper aufnahme.m4a --model small --language German --initial_prompt "Besprechung über Kubernetes, Terraform und die Migration bei der Gerabo GmbH."
Das ist keine Garantie, aber es verschiebt die Wahrscheinlichkeiten spürbar. Den Rest korrigierst du nach, am schnellsten mit Suchen-und-Ersetzen über die .txt.
Stufe 3: Experte, Weiterverarbeiten und automatisieren
Untertitel in ein Video einbinden
Die .srt ist eine fertige Untertiteldatei. Transkribier dein Video zuerst genauso wie die Audiodatei, Whisper liest die Tonspur direkt aus dem mp4:
whisper video.mp4 --model small --language German --output_dir transkript
Danach legst du die .srt mit ffmpeg als eigene Spur in das mp4. Das geht in Sekunden, weil Bild und Ton dabei unverändert kopiert werden:
ffmpeg -i video.mp4 -i transkript/video.srt -c copy -c:s mov_text video-mit-untertiteln.mp4
Bei YouTube brauchst du das gar nicht: Du lädst die .srt im Studio direkt als Untertitelspur hoch. Die Bezeichnungen im Menü können sich je nach Version unterscheiden.
Aus dem Transkript ein Protokoll machen
Ein Rohtranskript von einer Stunde Meeting liest niemand. Interessant wird es, wenn ein Sprachmodell daraus Entscheidungen und Aufgaben zieht. Kopier den Inhalt der .txt in ChatGPT oder Claude und schick diesen Prompt hinterher:
Wichtig: Sobald du das Transkript in ein Cloud-Modell kopierst, verlässt der Inhalt deinen Rechner. Der lokale Vorteil von Whisper endet an dieser Stelle. Bei vertraulichen Aufnahmen bleibt es beim Transkript, oder du nutzt ein lokal laufendes Sprachmodell.
Einen ganzen Ordner in einem Durchlauf
Whisper nimmt beliebig viele Dateien als Argumente. Damit transkribierst du ein Archiv über Nacht:
# macOS und Linux
whisper *.m4a --model turbo --language German --output_dir transkripte
In der PowerShell löst nicht die Shell das Sternchen auf, sondern das Programm, und Whisper kann das nicht. Dort gibst du die Dateien einzeln weiter:
Get-ChildItem *.m4a | ForEach-Object { whisper $_.Name --model turbo --language German --output_dir transkripte }
Das Datenschutzargument, sauber gezogen
Beim lokalen Betrieb geht keine Audiodatei ins Netz. Die einzige Verbindung nach außen ist der einmalige Modell-Download. Das ist der Grund, warum Whisper für Interviews, Personalgespräche und Forschungsdaten funktioniert, wo ein Cloud-Dienst eine Auftragsverarbeitung und eine Rechtsgrundlage bräuchte. Ein DSGVO-Freibrief ist es trotzdem nicht: Für die Aufnahme selbst brauchst du weiterhin die Einwilligung der Beteiligten, und das Transkript ist genauso schützenswert wie das Audio.
Ehrliche Grenzen
- Keine Sprechertrennung. Whisper liefert einen durchlaufenden Text ohne „Person A” und „Person B”. Diarisierung ist ein eigener Arbeitsschritt mit zusätzlicher Software.
- Zahlen, Namen und Daten immer prüfen. Genau dort sitzen die Fehler, und genau dort tun sie am meisten weh.
- Halluzinationen bei Stille. In langen Pausen oder bei sehr schlechtem Audio erfindet Whisper gelegentlich Sätze. Wenn ein Satz seltsam glatt wirkt, hör die Stelle nach.
- Kein Echtzeit-Betrieb. Whisper verarbeitet Dateien, keine laufende Aufnahme.
Häufige Fragen
Läuft Whisper auf meinem Rechner, und welches Modell soll ich nehmen?
Fast sicher ja. tiny, base und small laufen auf jedem Rechner der letzten zehn Jahre, nur eben unterschiedlich schnell. Eine Grafikkarte oder ein Apple-Silicon-Chip beschleunigt es stark, notwendig ist beides nicht. Nimm small für den Einstieg und für alles, was du selbst noch einmal liest. turbo, sobald dir die Qualität wichtiger wird und dein Rechner mitmacht. large nur mit Grafikkarte, wenn das Transkript möglichst ohne Nachkorrektur weiterverwendet wird.
Was kostet Whisper wirklich?
Beim lokalen Betrieb nichts. Code und Modellgewichte stehen unter MIT-Lizenz, es gibt kein Konto, kein Kontingent und keine Zeichengrenze. Kosten entstehen nur, wenn du stattdessen die gehostete OpenAI-API nutzt: 0,006 USD pro Minute für GPT-4o Transcribe und 0,003 USD pro Minute für die Mini-Variante (OpenAI-Preisliste, abgerufen am 14. Juni 2026). Diesen Weg geht dieses Tutorial nicht. Deine realen Grenzen sind Rechenzeit und Speicherplatz, nicht Geld.
Werden meine Aufnahmen irgendwohin hochgeladen?
Nein. Nach dem einmaligen Modell-Download arbeitet Whisper vollständig offline, du kannst zur Kontrolle das WLAN ausschalten und das Kommando erneut starten. Anders sieht es aus, sobald du das fertige Transkript in einen Cloud-Chatbot kopierst.
Wie gut ist die deutsche Erkennung?
Bei klarer Aufnahme und Standarddeutsch sehr gut, ab small in vielen Fällen sauberer als eine schnelle Mitschrift von Hand. Schwieriger wird es bei starkem Dialekt, mehreren gleichzeitig Sprechenden, Hall im Raum und Fachvokabular. Ein gutes Mikrofon bringt oft mehr als ein größeres Modell.
Wie lange dauert eine Stunde Audio?
Das hängt komplett an deiner Hardware, deshalb steht hier keine Zahl. Miss es einmal selbst: Lass eine Minute Audio mit deinem Wunschmodell laufen, stopp die Zeit und rechne mal 60. Diese eine Messung ist zuverlässiger als jede allgemeine Angabe und als jede Geschwindigkeitsangabe aus einer Modelltabelle.
Dein nächster Schritt
Du hast jetzt eine Transkriptionsmaschine auf deinem Rechner, die nichts kostet, nichts hochlädt und beliebig oft läuft. Der Aufwand steckte in der Installation, und die machst du genau einmal.
Nimm dir als nächstes eine echte Aufnahme vor: die Sprachnachricht, die du nie abgetippt hast, die Vorlesungsmitschrift, das Interview aus dem letzten Projekt. Danach führen zwei Wege weiter:
- Whisper im Detail: Modellvarianten, Grenzen und die Einordnung gegenüber kommerziellen Transkriptionsdiensten.
- Deine eigene KI-Stimme mit ElevenLabs: der umgekehrte Weg, von Text zurück zu Sprache.
Wie gut kennst du Whisper jetzt?
10 Fragen, von der Installation bis zu den Untertiteln im Video. Wer alle schafft, bekommt ein Zertifikat zum Teilen.