Zum Inhalt springen
Fortgeschritten ⏱ 35 Min. 🔨 whisper

Dein erstes Transkript mit Whisper: in 15 Minuten

Dein Ziel nach diesem Tutorial:

Du transkribierst heute noch deine erste eigene Aufnahme, lokal und ohne Upload

Tutorial teilen:

Whisper ist OpenAIs Spracherkennungsmodell, Code und Modellgewichte stehen unter MIT-Lizenz. Es läuft auf deinem eigenen Rechner: kein Konto, keine Kreditkarte, 0 Euro. Du nimmst zwei Minuten Sprache auf, startest ein einziges Kommando im Terminal und hast nach 15 Minuten ein Transkript als .txt und eine Untertiteldatei als .srt. Deine Aufnahme verlässt dabei nie deinen Rechner, deshalb taugt der Weg auch für Interviews, Personalgespräche und Vorlesungen.


Stufe 1: Anfänger, Dein erstes Transkript in 15 Minuten

Der Weg führt über das Terminal. Es gibt auch grafische Oberflächen für Whisper, hier bleibt es beim Kommando: Damit steuerst du Modellgröße, Sprache und Ausgabeordner direkt. Die 15 Minuten gelten für einen Rechner, auf dem schon ein Paketmanager läuft (Homebrew, winget oder Chocolatey, apt). Fehlt der, rechne dessen Installation obendrauf.

Schritt 1: Zwei Minuten Sprache aufnehmen

Nimm mit der Sprachmemo-App deines Handys oder deines Rechners zwei Minuten auf. Erzähl, was du diese Woche vorhast, lies eine Zeitungsseite vor, halte ein kurzes Selbstgespräch über ein Projekt. Der Inhalt ist egal, die Länge ist wichtig: zwei Minuten laufen auch auf einem älteren Rechner schnell durch.

Leg die Datei in einen eigenen Ordner, zum Beispiel Dokumente/transkription, und benenne sie aufnahme.m4a. Whisper frisst so gut wie jedes Format: m4a, mp3, wav, flac, und auch die Tonspur aus mp4-Videos.

Schritt 2: Voraussetzungen installieren

Du brauchst zwei Dinge: Python und ffmpeg. Öffne das Terminal (macOS: Spotlight, „Terminal”; Windows: PowerShell) und prüf zuerst Python:

python3 --version

Kommt eine Versionsnummer ab 3.8 zurück, bist du fertig. Sonst hol dir Python von python.org.

Dann ffmpeg, das Whisper zum Einlesen der Audiodatei braucht:

# macOS, mit Homebrew: https://brew.sh/
brew install ffmpeg

# Windows, mit winget (bei Windows 11 an Bord)
winget install Gyan.FFmpeg

# Windows, mit Chocolatey: https://chocolatey.org/install
# PowerShell dafür als Administrator öffnen
choco install ffmpeg

# Ubuntu / Debian
sudo apt update && sudo apt install ffmpeg

Und zuletzt Whisper selbst. Nutz python3 -m pip, dann landet das Paket sicher bei genau dem Python, das du eben geprüft hast:

python3 -m pip install -U openai-whisper

Das dauert ein paar Minuten, weil PyTorch mitkommt. Ein Konto legst du nirgends an.

Bricht die Installation mit error: externally-managed-environment ab, schützt dein System sein eigenes Python (üblich bei Homebrew-Python, Debian ab 12 und Ubuntu ab 23.04). Dann arbeitest du in einer eigenen Umgebung:

python3 -m venv ~/whisper-env
source ~/whisper-env/bin/activate    # Windows: ~\whisper-env\Scripts\Activate.ps1
python3 -m pip install -U openai-whisper

Die Umgebung aktivierst du in jedem neuen Terminal einmal, bevor du Whisper startest.

Schritt 3: Das eine Kommando

Wechsel im Terminal in deinen Ordner und starte:

whisper aufnahme.m4a --model small --language German --output_dir transkript

Was dabei passiert: Whisper lädt beim allerersten Lauf das Modell small herunter, das ist der Teil, der Zeit kostet. Danach liegt es lokal und wird nie wieder geladen. Anschließend zerlegt Whisper deine Aufnahme in Abschnitte, erkennt die Sprache und schreibt die Ergebnisse als Dateien in den Ordner transkript.

Die drei Angaben sind bewusst gesetzt. --model small ist der beste Kompromiss aus Qualität und Wartezeit für den ersten Lauf. --language German spart die automatische Spracherkennung und verhindert, dass ein deutsches Gespräch als Niederländisch erkannt wird. --output_dir hält deinen Ordner sauber.

Schritt 4: Dein Ergebnis öffnen

Im Ordner transkript liegen jetzt mehrere Dateien mit dem Namen deiner Aufnahme. Whisper schreibt standardmäßig alle Formate auf einmal:

DateiWas drinstehtWofür
.txtreiner Fließtext ohne ZeitenLesen, weiterverarbeiten
.srtTextblöcke mit ZeitmarkenUntertitel für Video
.vttUntertitel im Web-FormatHTML5-Video, YouTube
.tsvZeiten und Text tabellarischTabellenkalkulation
.jsonalle Segmente mit Metadateneigene Skripte

Öffne die .txt. Das ist dein erstes Transkript, erzeugt komplett offline. Brauchst du nur ein Format, häng --output_format txt ans Kommando.


Stufe 2: Fortgeschritten, Qualität steuern

Modellgrößen gegen Rechenzeit

Whisper gibt es in sechs Größen. Die Zahlen stammen aus der offiziellen Modelltabelle des Projekts (github.com/openai/whisper, abgerufen am 30. August 2026):

ModellParameterSpeicherbedarfRelative Geschwindigkeit
tiny39 Mio.~1 GB~10x
base74 Mio.~1 GB~7x
small244 Mio.~2 GB~4x
medium769 Mio.~5 GB~2x
turbo809 Mio.~6 GB~8x
large1.550 Mio.~10 GB1x

Der Speicherbedarf bezieht sich auf Grafikspeicher. Ohne dedizierte Grafikkarte läuft alles über Prozessor und Arbeitsspeicher, dann ist es deutlich langsamer. Wichtig zur letzten Spalte: Die relative Geschwindigkeit ist laut Projektseite auf einer A100-Grafikkarte mit englischer Sprache gemessen. Auf einem Rechner ohne Grafikkarte gelten diese Verhältnisse nicht, dort schlägt vor allem die Zahl der Parameter durch.

Nimm eine Minute Audio und lass sie durch tiny, small und turbo laufen. Bei sauber gesprochenem Deutsch wirst du zwischen small und turbo wenig Unterschied hören, bei Nebengeräuschen, Dialekt oder mehreren Sprechenden dagegen viel. turbo ist die interessante Größe: laut Tabelle sogar etwas schneller als base, bei zehnmal so vielen Parametern. Auf einem Rechner ohne Grafikkarte gilt dieser Vorsprung allerdings nicht, dort ist turbo spürbar langsamer als die kleinen Modelle. Für Übersetzung ist es laut Projektseite nicht trainiert und gibt bei --task translate die Originalsprache zurück.

Sprache erzwingen

Ohne --language rät Whisper anhand der ersten Sekunden. Bei Musik am Anfang, einer englischen Begrüßung oder leiser Aufnahme geht das schief, und dann bekommst du ein deutsches Gespräch in ausgedachtem Englisch zurück. Setz --language German immer, wenn du weißt, was gesprochen wird.

Die häufigsten Fehler

  • „ffmpeg not found”: ffmpeg fehlt oder ist nicht im Suchpfad. Nach der Installation das Terminal einmal komplett schließen und neu öffnen, dann ffmpeg -version prüfen.
  • „whisper: command not found”: Das Paket ist installiert, aber das Verzeichnis mit dem Startskript liegt nicht im Suchpfad. Arbeite in der virtuellen Umgebung aus Stufe 1, oder ruf Whisper direkt über Python auf: python3 -m whisper aufnahme.m4a --model small --language German.
  • Modell-Download bricht ab: Whisper legt Modelle unter ~/.cache/whisper ab und prüft dort die Prüfsumme. Eine unvollständige Datei lädt es beim nächsten Lauf automatisch neu, du startest das Kommando also einfach noch einmal.
  • Sehr langsame Verarbeitung: Auf älteren Rechnern ohne Grafikkarte kann eine Stunde Audio mit medium oder large mehrere Stunden dauern. Geh eine Modellgröße runter, oder wechsel auf faster-whisper beziehungsweise whisper.cpp. Beides sind eigenständige Neuimplementierungen desselben Modells, die auf Prozessoren deutlich schneller laufen.

Fachbegriffe und Eigennamen

Am häufigsten falsch sind genau die Wörter, die in normalem gesprochenem Deutsch selten vorkommen: Produktnamen, Abkürzungen, Nachnamen, Fachvokabular. Whisper sagt jeweils das nächste wahrscheinliche Wort voraus, und ein seltener Eigenname ist per Definition unwahrscheinlicher als ein alltägliches Wort, das ähnlich klingt.

Dagegen hilft --initial_prompt. Du gibst Whisper einen kurzen Text mit, der die erwarteten Begriffe in korrekter Schreibweise enthält:

whisper aufnahme.m4a --model small --language German --initial_prompt "Besprechung über Kubernetes, Terraform und die Migration bei der Gerabo GmbH."

Das ist keine Garantie, aber es verschiebt die Wahrscheinlichkeiten spürbar. Den Rest korrigierst du nach, am schnellsten mit Suchen-und-Ersetzen über die .txt.


Stufe 3: Experte, Weiterverarbeiten und automatisieren

Untertitel in ein Video einbinden

Die .srt ist eine fertige Untertiteldatei. Transkribier dein Video zuerst genauso wie die Audiodatei, Whisper liest die Tonspur direkt aus dem mp4:

whisper video.mp4 --model small --language German --output_dir transkript

Danach legst du die .srt mit ffmpeg als eigene Spur in das mp4. Das geht in Sekunden, weil Bild und Ton dabei unverändert kopiert werden:

ffmpeg -i video.mp4 -i transkript/video.srt -c copy -c:s mov_text video-mit-untertiteln.mp4

Bei YouTube brauchst du das gar nicht: Du lädst die .srt im Studio direkt als Untertitelspur hoch. Die Bezeichnungen im Menü können sich je nach Version unterscheiden.

Aus dem Transkript ein Protokoll machen

Ein Rohtranskript von einer Stunde Meeting liest niemand. Interessant wird es, wenn ein Sprachmodell daraus Entscheidungen und Aufgaben zieht. Kopier den Inhalt der .txt in ChatGPT oder Claude und schick diesen Prompt hinterher:

Rohtranskript zu Protokoll mit Aufgabenliste
Unten steht das Rohtranskript einer Besprechung vom [Datum] zum Thema [Thema]. Es stammt aus einer automatischen Spracherkennung, enthält also Erkennungsfehler und keine Sprechertrennung. Erstelle daraus ein Protokoll in vier Teilen: 1. Zusammenfassung in maximal fünf Sätzen. 2. Getroffene Entscheidungen, als Liste, jeweils ein Satz. 3. Offene Fragen, die im Gespräch nicht geklärt wurden. 4. Aufgabenliste als Tabelle mit den Spalten Aufgabe, verantwortlich, Frist. Wenn eine verantwortliche Person oder eine Frist im Transkript nicht genannt wird, schreib "offen" statt zu raten. Zwei Regeln: Erfinde nichts, was nicht im Transkript steht. Und markiere Stellen, an denen du wegen offensichtlicher Erkennungsfehler unsicher bist, mit [unklar]. Hier ist das Transkript: [Transkript einfügen]
Funktioniert mit ChatGPT, Claude, Gemini

Wichtig: Sobald du das Transkript in ein Cloud-Modell kopierst, verlässt der Inhalt deinen Rechner. Der lokale Vorteil von Whisper endet an dieser Stelle. Bei vertraulichen Aufnahmen bleibt es beim Transkript, oder du nutzt ein lokal laufendes Sprachmodell.

Einen ganzen Ordner in einem Durchlauf

Whisper nimmt beliebig viele Dateien als Argumente. Damit transkribierst du ein Archiv über Nacht:

# macOS und Linux
whisper *.m4a --model turbo --language German --output_dir transkripte

In der PowerShell löst nicht die Shell das Sternchen auf, sondern das Programm, und Whisper kann das nicht. Dort gibst du die Dateien einzeln weiter:

Get-ChildItem *.m4a | ForEach-Object { whisper $_.Name --model turbo --language German --output_dir transkripte }

Das Datenschutzargument, sauber gezogen

Beim lokalen Betrieb geht keine Audiodatei ins Netz. Die einzige Verbindung nach außen ist der einmalige Modell-Download. Das ist der Grund, warum Whisper für Interviews, Personalgespräche und Forschungsdaten funktioniert, wo ein Cloud-Dienst eine Auftragsverarbeitung und eine Rechtsgrundlage bräuchte. Ein DSGVO-Freibrief ist es trotzdem nicht: Für die Aufnahme selbst brauchst du weiterhin die Einwilligung der Beteiligten, und das Transkript ist genauso schützenswert wie das Audio.

Ehrliche Grenzen

  • Keine Sprechertrennung. Whisper liefert einen durchlaufenden Text ohne „Person A” und „Person B”. Diarisierung ist ein eigener Arbeitsschritt mit zusätzlicher Software.
  • Zahlen, Namen und Daten immer prüfen. Genau dort sitzen die Fehler, und genau dort tun sie am meisten weh.
  • Halluzinationen bei Stille. In langen Pausen oder bei sehr schlechtem Audio erfindet Whisper gelegentlich Sätze. Wenn ein Satz seltsam glatt wirkt, hör die Stelle nach.
  • Kein Echtzeit-Betrieb. Whisper verarbeitet Dateien, keine laufende Aufnahme.

Häufige Fragen

Läuft Whisper auf meinem Rechner, und welches Modell soll ich nehmen?

Fast sicher ja. tiny, base und small laufen auf jedem Rechner der letzten zehn Jahre, nur eben unterschiedlich schnell. Eine Grafikkarte oder ein Apple-Silicon-Chip beschleunigt es stark, notwendig ist beides nicht. Nimm small für den Einstieg und für alles, was du selbst noch einmal liest. turbo, sobald dir die Qualität wichtiger wird und dein Rechner mitmacht. large nur mit Grafikkarte, wenn das Transkript möglichst ohne Nachkorrektur weiterverwendet wird.

Was kostet Whisper wirklich?

Beim lokalen Betrieb nichts. Code und Modellgewichte stehen unter MIT-Lizenz, es gibt kein Konto, kein Kontingent und keine Zeichengrenze. Kosten entstehen nur, wenn du stattdessen die gehostete OpenAI-API nutzt: 0,006 USD pro Minute für GPT-4o Transcribe und 0,003 USD pro Minute für die Mini-Variante (OpenAI-Preisliste, abgerufen am 14. Juni 2026). Diesen Weg geht dieses Tutorial nicht. Deine realen Grenzen sind Rechenzeit und Speicherplatz, nicht Geld.

Werden meine Aufnahmen irgendwohin hochgeladen?

Nein. Nach dem einmaligen Modell-Download arbeitet Whisper vollständig offline, du kannst zur Kontrolle das WLAN ausschalten und das Kommando erneut starten. Anders sieht es aus, sobald du das fertige Transkript in einen Cloud-Chatbot kopierst.

Wie gut ist die deutsche Erkennung?

Bei klarer Aufnahme und Standarddeutsch sehr gut, ab small in vielen Fällen sauberer als eine schnelle Mitschrift von Hand. Schwieriger wird es bei starkem Dialekt, mehreren gleichzeitig Sprechenden, Hall im Raum und Fachvokabular. Ein gutes Mikrofon bringt oft mehr als ein größeres Modell.

Wie lange dauert eine Stunde Audio?

Das hängt komplett an deiner Hardware, deshalb steht hier keine Zahl. Miss es einmal selbst: Lass eine Minute Audio mit deinem Wunschmodell laufen, stopp die Zeit und rechne mal 60. Diese eine Messung ist zuverlässiger als jede allgemeine Angabe und als jede Geschwindigkeitsangabe aus einer Modelltabelle.


Dein nächster Schritt

Du hast jetzt eine Transkriptionsmaschine auf deinem Rechner, die nichts kostet, nichts hochlädt und beliebig oft läuft. Der Aufwand steckte in der Installation, und die machst du genau einmal.

Nimm dir als nächstes eine echte Aufnahme vor: die Sprachnachricht, die du nie abgetippt hast, die Vorlesungsmitschrift, das Interview aus dem letzten Projekt. Danach führen zwei Wege weiter:


Wie gut kennst du Whisper jetzt?

10 Fragen, von der Installation bis zu den Untertiteln im Video. Wer alle schafft, bekommt ein Zertifikat zum Teilen.

Whisper-Quiz
1 / 10

Was passiert mit deiner Aufnahme, wenn du Whisper lokal laufen lässt?

Für Unternehmen

Du willst das für dein Team?

Alleine brauchst du dafür 35 Min. Mit deinem Team wird daraus ein Training: dieselben Werkzeuge, aber eure Aufgaben, eure Daten, eure Fragen. Im kostenlosen Erstgespräch, 30 Minuten, sagen wir dir ehrlich, ob Beratung, ein Training oder ein Projekt der nächste sinnvolle Schritt ist. Oder ob gerade keiner nötig ist.

KI-Training anfragen

Kostenlos, jeden Freitag

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.