Zum Inhalt springen
Alle Levels ⏱ Gesamt 150 Min. 🔨 Home Assistant 🔨 Ollama

Deine erste Sprachsteuerung ohne Cloud: Home Assistant mit lokaler KI, in 30 Minuten

Dein Ziel nach diesem Tutorial:

Du schaltest heute noch dein erstes Gerät per Sprache, komplett lokal und ohne Cloud

Kurzfazit: Für alle, die Alexa oder Google nicht im Wohnzimmer haben wollen: Mit Home Assistant, der App Speech-to-Phrase und der Sprachausgabe Piper schaltest du nach 30 Minuten dein erstes Gerät per Zuruf, und laut Dokumentation verlässt kein gesprochenes Wort dein Haus. Die Software kostet 0 €. Die ehrliche Grenze ist die Hardware: Ein Rechner muss dafür rund um die Uhr laufen, und die lokale Erkennung versteht nur einen festen Satzvorrat.

Alexa hört in der Küche mit, Google im Wohnzimmer. Wer das nicht will, hatte lange nur die Wahl zwischen Mithören und Lichtschalter. Home Assistant räumt sie ab: Erkennung, Verstehen und Antwort laufen auf deiner eigenen Hardware. Das ist das aufwendigste Tutorial dieser Reihe. Die 30 Minuten sind Stufe 1, die 150 Minuten die ganze Anleitung.


Was das kostet

BausteinPreisEhrliche Grenze
Home Assistant, Software0 €Setzt ein laufendes Home Assistant Operating System voraus
Hardware dafür, etwa Home Assistant Green179 €1,8 GHz Quad-Core-ARM, 4 GB RAM. Genug für Stufe 1 und 2, zu wenig für Stufe 3
Speech-to-Phrase und Piper, zwei Apps0 €Fester Satzvorrat, und Pipers Standardstimme ist englisch
Mikrofon: dein Handy mit der Home-Assistant-App0 €Du drückst einen Knopf, das Weckwort ist experimentell
Voice Preview Edition, optional59 € inklusive Steuer, 69 USD zuzüglich SteuerWeckwörter nur auf Englisch
Ollama plus qwen3.5:4b für Stufe 30 €Zweiter Rechner nötig, empfohlen 8 GB VRAM oder Unified Memory
Home Assistant Cloud, die Abkürzung7,50 € pro Monat, 75 € im JahrDeine Sprache geht an einen Server

Quellen: Home Assistant Green, Voice Preview Edition, Nabu-Casa-Preise, die Anleitung zum lokalen Sprachassistenten und der Ollama-Schnellstart, abgerufen am 17. September 2026. Der Posten, der hier zählt, ist nicht der Preis, sondern der Strom.


Stufe 1: Anfänger, dein erstes Gerät per Sprache in 30 Minuten

Was du brauchst

  • Home Assistant Operating System, laufend. Laut Installationsseite genügt ein Raspberry Pi 4 oder 5 mit mindestens 2 GB RAM, ein Home Assistant Green oder ein x86-64-Rechner.
  • Ein Admin-Konto und mindestens ein schaltbares Gerät, das schon eingebunden ist.
  • Die Home-Assistant-App auf dem Handy. Sie ist in Stufe 1 dein Mikrofon.

Schritt für Schritt

  1. Apps installieren: Settings > Apps > Install app. Die Einträge hießen früher Add-ons, je nach Version steht dort noch Add-ons. Such Speech to phrase, klick auf INSTALL, dann dasselbe für Piper. Starte danach beide.
  2. Dienste verbinden: Unter Settings > Devices & services taucht laut Anleitung beides als Fund der Wyoming-Integration auf. Klick bei jedem auf Add.
  3. Assistenten anlegen: Settings > Voice assistants, dann Add assistant. Gib ihm einen Namen und wähl als Sprache Deutsch.
  4. Bausteine zuordnen: Unter Conversation agent wählst du Home Assistant, unter Speech-to-text die App Speech-to-Phrase samt Sprache, unter Text-to-speech Piper samt Sprache. Die Varianten dahinter sind die einzelnen Stimmen.
  5. Ein Gerät freigeben: Im Reiter Expose gibst du über Expose entities genau eine Lampe frei. Mehr nicht, sonst suchst du Fehler an zehn Stellen gleichzeitig. Türschlösser und Garagentore lässt du bewusst draußen.
  6. Erst tippen, dann sprechen: Öffne oben rechts auf dem Dashboard das Assist-Symbol und tipp einen der Sätze unten ein. Klappt das, öffne die App auf dem Handy, tipp oben rechts auf das Drei-Punkte-Menü und Assist, und sprich denselben Satz.
Starter-Prompt: deine ersten Sätze an Home Assistant
Schalte die [Schlafzimmerlampe] an Mach die [Schlafzimmerlampe] an [Schlafzimmerlampe] aus Schalte das Licht in der [Küche] an Licht in der [Küche] an Wie spät ist es Wie ist das Wetter Ersetze die eckigen Klammern durch den Namen, der in Home Assistant an deinem Gerät oder Raum steht. Die Klammern selbst schreibst du nicht mit.
Funktioniert mit Home Assistant, Assist

Die Satzmuster stammen aus den deutschen Testsätzen des Intents-Projekts, gegen die Home Assistant seine Erkennung selbst prüft.

So sieht ein gutes Ergebnis aus: Die Lampe geht an, und aus dem Handy kommt eine kurze deutsche Bestätigung, beim Licht zum Beispiel “Licht eingeschaltet”. Zwischen deinem letzten Wort und der Antwort liegt laut Voice Chapter 9 auf einem Home Assistant Green oder Raspberry Pi 4 weniger als eine Sekunde, auf einem Pi 5 rund 150 Millisekunden.

Der erste Fehler, gleich hier: Die Antwort kommt auf Englisch oder klingt, als würde ein Amerikaner Deutsch vorlesen. Dann steht Piper noch auf seiner Standardstimme en_US-lessac-medium. Öffne die App-Seite von Piper, geh in die Konfiguration und setz die Option voice auf de_DE-thorsten-medium. Stimmen heißen laut Piper-Doku nach dem Muster <Sprache>_<REGION>-<Name>-<Qualität>, auf Deutsch gibt es unter anderem thorsten, kerstin und eva_k. Bis medium läuft laut derselben Doku auf einem Pi 4 alles brauchbar schnell, high wird dort zäh.

Das ist dein erstes Ergebnis: ein Gerät, das auf gesprochenes Deutsch reagiert, ohne dass ein Wort davon einen fremden Server erreicht.


Stufe 2: Fortgeschritten, mehr Geräte, eigene Sätze, freie Hände

Namen, die die Erkennung versteht

Bevor du weitere Geräte freigibst, benennst du sie um. Home Assistant empfiehlt in den Best Practices das Schema <Bereich> [<Bezeichnung>] [<Gerätetyp>], also “Küchenlicht” statt “Hue 3”. Stehen deine Geräte auf Englisch, legst du laut derselben Seite Aliasse in deiner Sprache an. Das ist im Deutschen die wichtigste Stellschraube, weil dasselbe Ding je nach Satz “die Lampe”, “das Licht” oder “der Deckenspot” heißt.

Speech-to-Phrase trainiert sich laut App-Doku selbst auf deine freigegebenen Entitäten, Bereiche, Etagen und Satz-Trigger. Nach jedem neuen Namen gibst du der App also kurz Zeit.

Ein eigener deutscher Satz

Die eingebauten Sätze decken Licht, Rollläden, Szenen, Medien, Uhrzeit und Wetter ab. Alles darüber hinaus baust du selbst, und Speech-to-Phrase lernt es mit. Der Weg steht in der Anleitung zu eigenen Sätzen: Settings > Automations & Scenes, Create automation, im Menü Trigger der Eintrag Sentence, dann die Sätze ohne Satzzeichen eintragen. Für die Antwort: Add action, ganz nach unten auf Other actions, dann Set conversation response. Wer lieber YAML schreibt, fügt den Block hier über Edit in YAML ein.

Konfigurations-Schnipsel: dein eigener Satz als Automatisierung
alias: Gute Nacht triggers: - trigger: conversation command: - "gute nacht" - "ich gehe (schlafen|ins bett)" actions: - action: light.turn_off target: area_id: [wohnzimmer] - set_conversation_response: "Gute Nacht. Licht ist aus." mode: single
Funktioniert mit Home Assistant, Settings > Automations & Scenes

Runde Klammern sind Alternativen, eckige stehen laut Doku zum Satz-Trigger für optionale Wörter. Satzzeichen und Großschreibung ignoriert Home Assistant. Ersetz [wohnzimmer] durch die ID deines Bereichs, die Klammern fallen weg.

Freie Hände

Solange du einen Knopf drückst, ist es ein Diktiergerät. Zwei Wege führen weiter:

  • Dein Android-Handy als Weckwort-Gerät. Unter Settings > Companion app > Assist for Android schaltest du laut Android-Anleitung die Weckworterkennung ein. Sie läuft mit microWakeWord auf dem Gerät, erst nach dem Weckwort geht Ton an Home Assistant. Die Funktion ist laut Doku experimentell und zieht deutlich mehr Akku als “Ok Google”, weil Google die stromsparende Spezialhardware dafür nicht für fremde Apps freigibt.
  • Eigene Hardware. Die Voice Preview Edition kostet 59 € inklusive Steuer, laut Produktseite mit ESP32-S3, zwei Mikrofonen und XMOS-XU316-Chip.

Auf Deutsch weckst du beide nur mit englischen Wörtern. openWakeWord unterstützt laut Weckwort-Doku ausschließlich englische Weckwörter, microWakeWord kennt okay nabu, hey jarvis und alexa. Deutsch bietet nur die ältere Engine Porcupine v1, praktisch beschränkt auf “Stachelschwein”.

Die drei Fehler, die dir garantiert begegnen

1. Assist kennt dein Gerät nicht. Symptom: Der Satz wird erkannt, die Antwort lautet sinngemäß, es gebe kein solches Gerät. Ursache: Die Entität ist nicht freigegeben, oder der Name im System passt nicht zu deinem Wort. Lösung: Im Reiter Expose freigeben und einen Alias in deiner Alltagssprache anlegen.

2. Ein ganzer Satz kommt nie an. Symptom: Andere Sätze funktionieren, dieser eine nie. Ursache: Speech-to-Phrase ist laut Voice Chapter 9 ein geschlossenes Modell und erkennt nur bekannte Sätze. Einkaufslisten, benannte Timer und Durchsagen gehören ausdrücklich nicht dazu. Lösung: Bleib bei den Mustern aus Stufe 1, oder leg dir den Satz wie oben als Automatisierung an.

3. Namen mit Zahlen oder Abkürzungen kommen falsch an. Symptom: “Lampe 2” oder “TV” landen als Kauderwelsch im Protokoll. Ursache: Speech-to-Phrase zerlegt beim Training Wörter mit Ziffern, trennt Abkürzungen in Buchstaben und rät bei unbekannten Wörtern die Aussprache. Lösung: Gib dem Gerät einen aussprechbaren Namen oder Alias, etwa “Leselampe” statt “Lampe 2”.


Stufe 3: Experte, frei formulierte Sätze mit einem lokalen Sprachmodell

Bis hierhin versteht dein Haus feste Sätze. “Mir ist kalt im Wohnzimmer” versteht es nicht. Dafür hängst du ein Sprachmodell dazwischen, das auf deinem eigenen Rechner läuft. Plan den größten Teil der 150 Minuten dafür ein.

Ollama auf einem zweiten Rechner

Die Ollama-Integration braucht laut Doku einen externen Ollama-Server für macOS, Linux oder Windows. Auf einem Home Assistant Green mit 4 GB RAM ist dafür kein Platz, das übernimmt dein normaler Rechner.

  1. Installier Ollama von ollama.com/download.
  2. Lad das Modell: ollama pull qwen3.5:4b, laut Modellseite 3,4 GB groß. Ollama empfiehlt im Schnellstart für diese Größenordnung 8 GB VRAM oder Unified Memory.
  3. Mach den Server im Netz erreichbar. Ollama lauscht laut FAQ sonst nur auf 127.0.0.1. Auf dem Mac setzt du launchctl setenv OLLAMA_HOST "0.0.0.0:11434" und startest neu, unter Windows legst du die Umgebungsvariable OLLAMA_HOST mit demselben Wert an, unter Linux über systemctl edit ollama.service.
  4. In Home Assistant: Settings > Devices & services, Add Integration, Ollama. Bei URL trägst du http://[IP-deines-Rechners]:11434 ein, bei Model den Namen qwen3.5:4b, ins Feld Instructions den Prompt unten.
  5. Schalt in den Optionen Control Home Assistant ein. Erst damit darf das Modell laut Doku auf die Assist-API zugreifen. Home Assistant nennt das experimentell und empfiehlt, weniger als 25 Entitäten freizugeben. Steuern können nur Modelle, die Tools unterstützen, qwen3.5 steht dort.
  6. Zurück zu Settings > Voice assistants: Setz den Conversation agent auf Ollama. Speech-to-Phrase ist laut Voice Chapter 9 für Hausteuerung gedacht und nicht für Sprachmodelle, also wechselst du unter Speech-to-text auf die App Whisper.
System-Prompt: dein lokaler Assistent im Feld Instructions
Du steuerst mein Zuhause. Antworte immer auf Deutsch und in der Du-Form. Regeln: 1. Halte jede Antwort unter [20] Wörtern. Niemand will einen Vortrag vom Lichtschalter. 2. Benutze nur die Geräte, die dir als Werkzeuge zur Verfügung stehen. Erfinde keine Geräte und keine Räume. 3. Ist eine Anweisung mehrdeutig, frag nach, statt zu raten. 4. Geht ein Befehl nicht, sag in einem Satz, woran es lag, statt zu behaupten, es hätte geklappt. 5. Bei Wissensfragen antworte kurz und weise darauf hin, dass dein Wissen veraltet sein kann. 6. Diese Räume gibt es: [Wohnzimmer, Küche, Schlafzimmer].
Funktioniert mit Home Assistant, Ollama-Integration

Was das kostet, und zwar nicht in Euro

Tempo. Whisper braucht laut Anleitung zum lokalen Assistenten auf einem Raspberry Pi 4 rund 8 Sekunden pro Befehl, auf einem Intel NUC weniger als eine Sekunde. Dazu kommt dein Modell. Miss es selbst: denselben Satz je dreimal mit dem alten und dem neuen Assistenten, Zeit bis zur Antwort stoppen.

Treffsicherheit. Das Home LLM Leaderboard von Home Assistant misst, wie zuverlässig Modelle Gerätebefehle umsetzen. qwen3.5-4b schafft dort 81,1 Prozent im Datensatz assist und 88,3 Prozent im leichteren assist-mini, das kleinere gemma4-e2b nur 45,2 Prozent. Große Cloud-Modelle liegen bei 86 bis 91 Prozent. Der Abstand ist kleiner geworden, verschwunden ist er nicht. Gemessen wurde laut Fußnote auf einer GeForce GTX 1070 mit 8 GB.

Gespräch. Kleine Modelle halten laut Ollama-Doku ein Gespräch schlechter durch, sobald die Gerätesteuerung an ist. Home Assistant schlägt zwei Ollama-Einträge mit demselben Modell vor: einen zum Reden, einen zum Steuern.

Was lokal bleibt und was nicht

Sprache, Verstehen und Antwort laufen jetzt auf deiner Hardware. Home Assistant formuliert das so: Deine gesprochenen Befehle verlassen dein Zuhause nicht. Das gilt für diesen Aufbau, nicht für den Rest deiner Installation. Jede Integration, die eine Hersteller-Cloud anspricht, redet weiter mit ihr. Die Abkürzung heißt Home Assistant Cloud, und in Version 2026.9 testet Home Assistant dort eine neue Spracherkennung namens Soniox, die laut Release-Notiz Akzente, Hintergrundgeräusche und nicht-englische Sprachen besser trifft. Beide Wege schicken deine Stimme an einen Server. Genau darum geht es hier.


Häufige Fragen zu Sprachsteuerung mit Home Assistant

Was kostet eine Sprachsteuerung ohne Cloud?

0 € an Software. Home Assistant, Speech-to-Phrase, Piper und Ollama kosten nichts. Bezahlt wird Hardware: ein Home Assistant Green für 179 €, falls du keine hast, und optional die Voice Preview Edition für 59 €. Die Cloud-Variante kostet laut Preisseite 7,50 € pro Monat.

Funktioniert die lokale Sprachsteuerung wirklich auf Deutsch?

Ja, und besser als viele englische Anleitungen vermuten lassen. Speech-to-Phrase führt Deutsch in seiner Sprachliste, Piper hat mehrere deutsche Stimmen, und die Satzerkennung deckt laut Fortschrittsübersicht des Intents-Projekts im Deutschen 95 Prozent aller Kombinationen ab, 211 von 221, zwei mehr als Englisch. Home Assistant rät trotzdem, die Qualität in der eigenen Sprache zu prüfen.

Reicht ein Raspberry Pi 4, oder brauche ich einen Pi 5?

Für Stufe 1 und 2 reicht ein Pi 4. Speech-to-Phrase transkribiert dort laut Voice Chapter 9 in unter einer Sekunde, auf einem Pi 5 in rund 150 Millisekunden. Für Stufe 3 reicht keiner von beiden: Whisper braucht auf einem Pi 4 rund 8 Sekunden, und das Sprachmodell läuft ohnehin auf einem zweiten Rechner.

Home Assistant oder Alexa, was ist der Unterschied beim Datenschutz?

Der Ort der Verarbeitung. Hier laufen Erkennung, Verstehen und Sprachausgabe auf deiner Hardware, und Home Assistant schreibt dazu, dass deine gesprochenen Befehle dein Zuhause nicht verlassen. Bei Alexa und Google Home ist der Anbieter Teil der Kette. Du zahlst mit Einrichtungsaufwand, einem Gerät, das durchläuft, und englischen Weckwörtern.

Kann ich ein deutsches Weckwort benutzen?

Kaum. openWakeWord unterstützt derzeit nur englische Weckwörter, microWakeWord kennt okay nabu, hey jarvis und alexa. Deutsch gibt es laut Doku nur über die ältere Engine Porcupine v1, praktisch beschränkt auf “Stachelschwein”.

Brauche ich eine Grafikkarte für das Sprachmodell?

Nicht zwingend, aber etwas in der Größenordnung. Ollama empfiehlt 8 GB VRAM oder Unified Memory, ein Mac mit Apple-Chip erfüllt das ohne Grafikkarte.

Für wen ist dieses Tutorial nichts?

Für dich, wenn du heute Abend ein fertiges Gerät auspacken willst, wenn kein Rechner durchlaufen soll, oder wenn deine Geräte alle von einem Hersteller stammen und dessen App dir reicht. Dann ist ein fertiger Lautsprecher der ehrlichere Weg, und du zahlst mit Daten statt mit Zeit.


Dein nächster Schritt

Das Muster gilt für jede lokale KI: Das kleine Modell gewinnt nicht durch Können, sondern durch Zuschnitt. Speech-to-Phrase ist jedem Cloud-Dienst unterlegen und trotzdem schneller, weil es nur die Sätze kennen muss, die in deiner Wohnung vorkommen. Wer lokal arbeiten will, verkleinert die Aufgabe, statt das Modell zu vergrößern.

Deine erste Sprachsteuerung ohne Cloud ist 30 Minuten entfernt. Die Anleitung für den lokalen Aufbau steht bei Home Assistant.


Wie gut kennst du lokale Sprachsteuerung mit Home Assistant?

10 Fragen, von der Standardstimme bis zum Weckwort. Wer mindestens 8 richtig beantwortet, bekommt ein Zertifikat zum Teilen.

Home Assistant-Quiz
1 / 10

Welche zwei Apps brauchst du in Stufe 1 für eine komplett lokale Sprachsteuerung?

Für Unternehmen

Du willst das für dein Team?

Alleine brauchst du dafür 150 Minuten. Mit deinem Team wird daraus ein Training: dieselben Werkzeuge, aber eure Aufgaben, eure Daten, eure Fragen. Im kostenlosen Erstgespräch, 30 Minuten, sagen wir dir ehrlich, ob Beratung, ein Training oder ein Projekt der nächste sinnvolle Schritt ist. Oder ob gerade keiner nötig ist.

KI-Training anfragen

Kostenlos, jeden Freitag

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.

Tutorial teilen: