Zum Inhalt springen
Anfänger ⏱ Gesamt 25 Min. 🔨 ElevenLabs

Deine eigene KI-Stimme mit ElevenLabs: in 5 Minuten

Dein Ziel nach diesem Tutorial:

Du generierst heute noch dein erstes Audio mit einer KI-Stimme

Kurzfazit: Für alle, die Texte vertonen wollen, ohne Tonstudio und ohne Sprechtraining: Du fügst deinen Text in ElevenLabs ein, wählst eine Stimme und lädst nach 5 Minuten dein erstes Audio herunter. Der Free-Plan kostet 0 USD und bringt 10.000 Credits pro Monat, bei Text to Speech etwa 10.000 Zeichen. Die ehrliche Grenze: Kostenlos darfst du nichts kommerziell nutzen, und deine eigene Stimme klonst du erst ab dem Starter-Plan für 6 USD im Monat.

Stell dir vor, du könntest jeden Text mit deiner eigenen Stimme vorlesen lassen, ohne jedes Mal neu aufzunehmen. Eine Minute saubere Aufnahme reicht für den Anfang. Das ist Voice Cloning mit ElevenLabs. Die 5 Minuten sind Stufe 1 mit einer fertigen Stimme aus der Bibliothek, die 25 Minuten die ganze Anleitung bis zur geklonten Stimme.

Was das kostet

BausteinPreisEhrliche Grenze
ElevenLabs Free0 USD10.000 Credits pro Monat, keine kommerzielle Lizenz, bei Veröffentlichung Pflicht zur Nennung von “elevenlabs.io” im Titel, kein Voice Cloning, keine Übertragung ungenutzter Credits
Starter6 USD pro Monat, 5 USD pro Monat bei Jahreszahlung30.000 Credits pro Monat, kommerzielle Lizenz, Instant Voice Cloning
Creator22 USD pro Monat, im ersten Monat 11 USD, 18,33 USD pro Monat bei Jahreszahlung121.000 Credits pro Monat, Professional Voice Cloning
Pro99 USD pro Monat, 82,50 USD pro Monat bei Jahreszahlung600.000 Credits pro Monat
Credit-VerbrauchText to Speech etwa 1 Credit pro Zeichenalle Funktionen teilen sich denselben Credit-Topf

Quellen: elevenlabs.io/pricing mit den FAQ zu Credits, die ElevenLabs-Hilfeartikel zur kommerziellen Nutzung im Free-Plan und zum Voice Cloning nach Plan, abgerufen am 17. September 2026. Für dieses Tutorial zählen zwei Zeilen: Stufe 1 schaffst du kostenlos, Stufe 2 mit deiner eigenen Stimme setzt mindestens Starter voraus. Credits setzen sich zu Beginn jedes Abrechnungszeitraums zurück, bezahlte Pläne übertragen ungenutzte Credits bis zu zwei Monate.


Stufe 1: Anfänger, Dein erstes Audio in 5 Minuten

Was ist ElevenLabs?

ElevenLabs ist einer der bekanntesten Anbieter für KI-Sprachsynthese. Das Tool verwandelt Text in natürlich klingende Sprache, mit Stimmen aus der Bibliothek oder deiner eigenen geklonten Stimme. Der kostenlose Plan gibt dir 10.000 Credits pro Monat, Text to Speech verbraucht laut Preisseite etwa einen Credit pro Zeichen.

So legst du los:

  1. Gehe auf elevenlabs.io und leg ein kostenloses Konto an, der Google-Login reicht
  2. Öffne Text to Speech
  3. Wähl eine Stimme aus. Für deutschen Text nimmst du eine Stimme, die Deutsch als Muttersprache spricht: Laut Dokumentation behält jede Stimme ihren ursprünglichen Akzent
  4. Füge deinen Text ein und klick Generate
  5. Hör dir das Ergebnis an und lade es herunter

Läuft dein Text als Sprachaufnahme auf deinem Rechner, ist das dein erstes Ergebnis.

Dein erster Text zum Ausprobieren
Willkommen zum KI-Syndikat Podcast. Heute schauen wir uns an, wie künstliche Intelligenz das Arbeiten und Lernen verändert, und was das konkret für dich bedeutet. Ich bin dein Host, und das hier ist Folge eins.
Funktioniert mit ElevenLabs

Die wichtigsten Einstellungen kurz erklärt:

  • Stability: Hoch bedeutet gleichmäßige, konsistente Ausgaben. Niedrig bedeutet mehr Ausdrucksstärke, aber mehr Varianz zwischen Generierungen. Laut ElevenLabs ist ein Wert um 50 der häufigste Ausgangspunkt.
  • Similarity: Wie eng soll die KI der gewählten Stimme folgen? Bei einer verrauschten Vorlage reproduziert ein zu hoher Wert laut Dokumentation auch Störgeräusche. Starte um 75.
  • Style exaggeration: Verstärkt den Stil der Originalstimme, macht das Ergebnis aber etwas instabiler. Lass den Regler für den Anfang auf 0.
  • Speed: Standard ist 1,0, möglich sind 0,7 bis 1,2.

Beim Modell Eleven v3 fehlen laut Dokumentation die Regler Similarity und Speed, wundere dich also nicht, wenn sie je nach Modell verschwinden.

Die Stimmenbibliothek:

ElevenLabs bietet vorgefertigte Stimmen, die du nach Sprache und Stil filterst. Du findest sie im Bereich Voices in der linken Navigation. Für Deutsch nimmst du eine Stimme, die Deutsch als Muttersprache spricht, sonst klingt der Text mit fremdem Akzent. Hör dir immer ein Sample an, bevor du generierst.


ElevenLabs Text-to-Speech Workflow

Dein Text+ Stimmauswahlaus BibliothekElevenLabs KIanalysiert & synthetisiertnatürliche ProsodieMP3-Downloadsofort bereitfür alle PlayerPodcastVideo

Akademie-Training Platz vormerkbar

KI-Kompetenz nach Art. 4 KI-VO

490 € pro Platz, netto zzgl. USt. Einsteiger · 6 Wochen, online, im eigenen Tempo

Training ansehen

Stufe 2: Fortgeschritten, Voice Cloning

Was du brauchst

Für gutes Voice Cloning brauchst du eine saubere Audioaufnahme deiner Stimme und mindestens den Starter-Plan: Instant Voice Cloning gibt es laut ElevenLabs-Hilfe-Center erst ab Starter, im Free-Plan nicht. Das Handy-Sprachmemo reicht als Aufnahmegerät, wichtig ist ein ruhiger Raum ohne Hintergrundgeräusche.

So funktioniert Instant Voice Cloning:

  1. Nimm 1 bis 2 Minuten auf, natürlich sprechen, nicht zu schnell, variierte Sätze. Laut Dokumentation bringen mehr als 3 Minuten kaum Verbesserung und können dem Klon sogar schaden
  2. Wähl in ElevenLabs links den Bereich Voices und klick auf das Plus-Symbol
  3. Wähl im Fenster Instant Voice Clone
  4. Lade deine Aufnahme hoch oder nimm direkt auf, MP3 mit mindestens 128 kbps reicht laut Dokumentation
  5. Gib deiner Stimme einen Namen, zum Beispiel „Meine Stimme”, bestätige, dass du die Rechte und die Einwilligung zum Klonen hast, und klick Save voice
  6. Teste mit einem kurzen Text, ob der Klang stimmt

Tipps für eine gute Aufnahme:

  • Kein Hall, kein Echo, im Schlafzimmer oder einem Raum mit Teppichen aufnehmen
  • Natürliches Sprechtempo, keine übertriebene Modulation
  • Abwechslungsreiche Sätze: Fragen, Aussagen, kurze und lange Sätze
  • Vermeide Räuspern, Atemgeräusche und Pausen im Schnittmittelbereich
Testtext für deine geklonte Stimme
Heute teste ich meine eigene KI-Stimme. Klingt das wirklich wie ich? Ich finde es faszinierend, wie natürlich sich das anhört, und gleichzeitig leicht unheimlich. Die Technologie hinter Voice Cloning analysiert Tonhöhe, Rhythmus und Akzent aus einer einzigen Minute Aufnahme.
Funktioniert mit ElevenLabs

Speech to Speech, deine Ausdrucksstärke, andere Stimme

Speech to Speech ist das Gegenteil von Text-to-Speech: Du sprichst einen Text selbst ein, ausdrucksstark, mit natürlichem Rhythmus, und ElevenLabs überträgt diesen Rhythmus auf eine andere Stimme. Das ergibt deutlich natürlichere Betonungen als reines TTS, weil die emotionale Kurve erhalten bleibt.

Einstellungen für geklonte Stimmen:

  • Stability: Etwas niedriger als bei Bibliotheksstimmen setzen (40 bis 50), damit die individuelle Eigenheit deiner Stimme durchkommt
  • Similarity: 75 bis 85 für ein gutes Gleichgewicht zwischen Konsistenz und Natürlichkeit, bei verrauschter Aufnahme eher niedriger

Stufe 3: Experte, Studio und Podcast-Produktion

Audiobooks und lange Produktionen mit Studio

Für Inhalte, die länger als ein paar Absätze sind, nutzt du Studio, in älteren Anleitungen noch “Projects” genannt. Dort kannst du ein ganzes Dokument hochladen, verschiedenen Abschnitten verschiedene Stimmen zuweisen und Kapitel einzeln generieren. Laut Preisseite erlaubt der Free-Plan 3 Projekte in Studio, Starter 20.

So funktioniert es:

  1. Öffne in ElevenLabs Studio und leg ein neues Projekt an
  2. Lade ein Textdokument hoch oder füge deinen Text direkt ein
  3. Weise verschiedenen Sprechrollen unterschiedliche Stimmen zu
  4. Generiere Kapitel für Kapitel, so behältst du die Kontrolle
  5. Exportiere einzelne Abschnitte oder alles auf einmal
Podcast-Skript für Multi-Voice-Workflow (zwei Sprecher)
Host: Willkommen zurück. Heute haben wir einen besonderen Gast, jemanden, der täglich mit KI-Tools arbeitet und uns erzählt, was wirklich funktioniert. Gast: Danke für die Einladung. Ich freue mich, darüber zu sprechen, weil ich glaube, dass viele Leute KI falsch einsetzen. Host: Was meinst du damit genau? Gast: Die meisten nutzen KI wie eine Suchmaschine, sie fragen einmal und nehmen die erste Antwort. Aber KI wird wirklich mächtig, wenn du im Dialog bleibst. Nachfragen, verfeinern, iterieren. Host: Das ist ein guter Punkt. Hast du ein konkretes Beispiel? Gast: Klar. Wenn ich einen Artikel schreibe, fange ich mit einem groben Entwurf an und bitte die KI dann, bestimmte Abschnitte zu schärfen, nicht alles auf einmal, sondern gezielt.
Funktioniert mit ElevenLabs

Praktischer Produktions-Workflow:

  1. Skript schreiben, Claude oder ChatGPT für die Rohfassung nutzen
  2. ElevenLabs generieren, Stimme wählen oder eigene Stimme klonen
  3. Audio nachbearbeiten, CapCut (kostenlos, einfach) oder Descript für Schnitt und Pegel
  4. Veröffentlichen, Podbean, Spotify for Podcasters oder Buzzsprout als Hosting

Grenzen der aktuellen Technologie:

  • Sehr schnelles Sprechen wird manchmal verwaschen, bei schnellen Sätzen Stability erhöhen
  • Ungewöhnliche Namen und Fremdwörter werden manchmal falsch betont, mit phonetischer Schreibweise experimentieren (z. B. „Kwee” statt „Qi”)
  • Sehr emotionale Passagen (Weinen, Lachen) klingen noch synthetisch, Speech to Speech hilft hier
  • Dialekte werden nur unvollständig unterstützt, Standardsprache liefert zuverlässigere Ergebnisse

Voice Cloning Pipeline

Aufnahme1 bis 2 Min.sauberes AudioElevenLabsanalysiert Klang,Rhythmus, AkzentKlon-Modellgespeichert in„My Voices”Beliebiger Text→ Audio-AusgabeSpeech to Speech→ Betonung erhalten

Ethik und rechtliche Grundregeln:

  • Deine eigene Stimme: Darfst du klonen, ab dem Starter-Plan, der laut Preisseite auch die kommerzielle Lizenz enthält. Im Free-Plan gibt es weder Voice Cloning noch eine kommerzielle Lizenz.
  • Stimmen anderer Personen: Beim Anlegen eines Klons bestätigst du, dass du die Rechte und die Einwilligung der Person hast. Ohne ausdrückliche Einwilligung ist das tabu, auch wenn du das Ausgangsmaterial besitzt (z. B. ein Interview).
  • Deepfakes: Missbrauch verstößt gegen die Nutzungsbedingungen von ElevenLabs und kann zur Sperrung des Accounts führen, die Regeln stehen in den Terms of Service. Das ist keine Rechtsberatung, im Zweifel fragst du jemanden, der das beurteilen darf.
  • Prominente und öffentliche Personen: Gilt dasselbe wie bei Privatpersonen, keine Ausnahmen.

Häufige Fragen zu KI-Stimmen mit ElevenLabs

Klingt ElevenLabs-Audio erkennbar als KI?

Bei guten Einstellungen und klarem Text: für die meisten Zuhörer nicht. Der Unterschied zu echter menschlicher Stimme liegt vor allem in sehr langen Sätzen, ungewöhnlichen Wortfolgen und sehr emotionalen Momenten. Für Podcasts, Audiobooks und Voiceovers ist die Qualität seit 2024 auf professionellem Niveau.

Wie gut ist die deutsche Sprachqualität?

Sehr gut. ElevenLabs unterstützt Deutsch nativ, Betonung, Satzkadenz und Aussprache stimmen bei klaren, grammatisch korrekten Texten sehr gut. Dialekte und Umgangssprache sind schwächer. Englisch klingt nach wie vor etwas natürlicher, aber der Abstand hat sich stark verringert.

Darf ich Audiobooks kommerziell verkaufen?

Ab dem Starter-Plan für 6 USD im Monat, der laut Preisseite eine kommerzielle Lizenz enthält. Der kostenlose Plan enthält laut ElevenLabs-Hilfe-Center keine kommerzielle Lizenz, und wer dort Inhalte veröffentlicht, muss “elevenlabs.io” oder “11.ai” in den Titel schreiben. Prüf vor einem Verkauf die aktuellen Nutzungsbedingungen, das ist keine Rechtsberatung.

Kann ich die Stimme einer Prominenten klonen?

Nein. Beim Anlegen jedes Klons bestätigst du, dass du die Rechte und die Einwilligung der Person hast, ohne diese Einwilligung verstößt du gegen die Nutzungsbedingungen von ElevenLabs und in Deutschland sehr wahrscheinlich auch gegen das Persönlichkeitsrecht. Das ist keine Rechtsberatung, aber die Regel ist einfach: Du brauchst die ausdrückliche Einwilligung der Person.

Was passiert, wenn die kostenlosen 10.000 Credits aufgebraucht sind?

Du kannst bis zum Ende deines Abrechnungszeitraums keine weiteren Audios generieren. Laut Preisseite setzen sich die Credits zu Beginn jedes Abrechnungszeitraums zurück, nicht am Monatsersten, und im Free-Plan werden ungenutzte Credits nicht übertragen. Für mehr Credits musst du upgraden, Starter bringt 30.000 pro Monat.

Funktioniert ElevenLabs auch auf dem Handy?

Ja. Die Web-App ist mobiloptimiert und funktioniert im Browser auf iOS und Android. Eine native App gibt es ebenfalls, allerdings mit etwas weniger Einstellungsmöglichkeiten als die Desktop-Variante.


Dein nächster Schritt

Du hast jetzt alle Werkzeuge, um professionelle Sprachaufnahmen zu erstellen, ohne Tonstudio, ohne Mikrofon, ohne Nachbearbeitung. Eine saubere Handy-Aufnahme, eine bis zwei Minuten Sprechen und ein Starter-Plan, und deine eigene KI-Stimme ist fertig.

Starte jetzt: Gehe auf elevenlabs.io, erstelle einen kostenlosen Account und füge den Testtext aus Stufe 1 ein. Das erste Audio ist in unter 5 Minuten fertig.

Du brauchst noch einen Text, der sich zu hören lohnt? Dein erstes Kinderbuch mit Gemini schreibt eine Geschichte mit deinem Kind als Hauptfigur, und deine Stimme macht daraus das Hörbuch für die Autofahrt.


Wie gut kennst du ElevenLabs jetzt?

10 Fragen, von den kostenlosen Zeichenlimiten bis zu ethischen Regeln beim Voice Cloning. Wer mindestens 8 richtig beantwortet, bekommt ein Zertifikat zum Teilen.

ElevenLabs-Quiz
1 / 10

Wofür wird ElevenLabs hauptsächlich genutzt?

Für Unternehmen

Du willst das für dein Team?

Alleine brauchst du dafür 25 Minuten. Mit deinem Team wird daraus ein Training: dieselben Werkzeuge, aber eure Aufgaben, eure Daten, eure Fragen. Im kostenlosen Erstgespräch, 30 Minuten, sagen wir dir ehrlich, ob Beratung, ein Training oder ein Projekt der nächste sinnvolle Schritt ist. Oder ob gerade keiner nötig ist.

KI-Training anfragen

Kostenlos, jeden Freitag

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.

Tutorial teilen: