Kurzfazit: Für alle, die KI nutzen wollen, ohne ihre Texte in die Cloud zu schicken. Mit LM Studio und dem freien Modell Gemma 4 E4B oder Qwen3.5 4B schreibt dir nach 20 Minuten eine lokale KI den ersten Brief, bei ausgeschaltetem WLAN und ohne Konto. App und Modell kosten 0 USD, auch im Job. Die Grenze ist dein Rechner: Mac mit Apple-Chip oder Windows-PC mit AVX2, empfohlen sind 16 GB Arbeitsspeicher. Und lokal bleibt die KI schwächer als große Cloud-Modelle.
Alles, was du in einen Cloud-Chatbot tippst, geht an die Server des Anbieters: die Antwort an den Vermieter, die Frage zum Arztbrief. Bei einer lokalen KI liegt das Modell als Datei auf deiner Festplatte, und laut LM-Studio-Dokumentation verlässt nichts, was du im Chat eingibst, dein Gerät. Die 20 Minuten sind Stufe 1, die 60 Minuten die ganze Anleitung.
Was das kostet
| Baustein | Preis | Ehrliche Grenze |
|---|---|---|
| LM Studio (App) | 0 USD, privat und im Job | Kein Open Source, Lizenz nur für persönliche und interne geschäftliche Zwecke |
| Modell Gemma 4 E4B oder Qwen3.5 4B | 0 USD, Lizenz Apache 2.0 | 5,90 GB beziehungsweise 3,75 GB, die beim Laden in deinen Arbeitsspeicher passen müssen |
| Dein Rechner | 0 USD, wenn er passt | Mac mit Apple-Chip ab macOS 14, Windows mit AVX2 oder Snapdragon X Elite, 16 GB RAM empfohlen |
| LM Studio Bionic+ (optional) | 20 USD pro Monat | Nicht nötig: Cloud-Modelle auf US-Servern, also gerade nicht offline |
Quellen: Nutzungsbedingungen (Fassung vom 23. August 2026), Systemanforderungen, Gemma-4-Modellseite, Qwen3.5-Modellseite und Preisseite, abgerufen am 17. September 2026. Kostenlos im Job ist LM Studio laut Hersteller-Blog seit Juli 2025. Die Grenze, die hier zählt, ist dein Arbeitsspeicher.
Stufe 1: Anfänger, deine erste Offline-KI in 20 Minuten
Was du brauchst
- Einen Mac mit Apple-Chip (M1 oder neuer) und macOS 14 oder neuer, oder einen Windows-PC mit x64-Prozessor mit AVX2 oder mit Snapdragon X Elite
- 16 GB Arbeitsspeicher empfiehlt LM Studio, ein Mac mit 8 GB reicht laut Systemanforderungen für kleine Modelle
- Freien Speicherplatz für die App und das Modell, das allein 3,75 GB oder 5,90 GB belegt (siehe Schritt 3)
- Internet nur für die Downloads, ein Konto verlangt die Einstiegsanleitung nicht
Menünamen stehen hier auf Englisch und in Klammern auf Deutsch, beide aus den Übersetzungsdateien von LM Studio.
Schritt 1: Prüfen, ob dein Rechner passt
Auf dem Mac wählst du im Apple-Menü Über diesen Mac und siehst unter Chip, ob ein Apple-Chip verbaut ist (Apple-Hilfe). Steht dort stattdessen Prozessor mit einem Intel-Namen, hörst du hier auf: Intel-Macs unterstützt LM Studio derzeit nicht. Deinen Arbeitsspeicher zeigt die App Aktivitätsanzeige unter Speicher als Physischer Speicher (Apple-Hilfe). Unter Windows öffnest du Einstellungen, System und Info, unter Gerätespezifikationen stehen Prozessor und RAM (Microsoft-Hilfe). Ob der Prozessor AVX2 beherrscht, steht auf der Produktseite des Herstellers.
Schritt 2: LM Studio installieren
Öffne lmstudio.ai/download. Ganz oben steht LM Studio Bionic, laut Hersteller eine eigene Agenten-App. Du scrollst weiter zu Download LM Studio (am 17. September 2026 Version 0.4.24), lädst die Fassung für dein System und installierst sie.
Schritt 3: Das passende Modell herunterladen
Starte LM Studio. Eine Einführung überspringst du mit Skip onboarding (Onboarding überspringen). Die Modellsuche öffnest du laut Release Notes 0.4.0 über das Lupen-Symbol oben rechts oder mit Cmd/Strg + Shift + M. Je nach Version heißt der Einstieg Discover (Entdecken), laut Dokumentation mit Cmd/Strg + 2. Tipp den Suchbegriff ein, der zu deinem Arbeitsspeicher passt:
| Dein Arbeitsspeicher | Modell für Stufe 1 | Suchbegriff | Download |
|---|---|---|---|
| 8 GB | Qwen3.5 4B | qwen/qwen3.5-4b | 3,75 GB |
| 16 GB oder mehr | Gemma 4 E4B | google/gemma-4-e4b | 5,90 GB |
Größen laut Modellseiten zu Qwen3.5 und Gemma 4. Findet die Suche nichts, tipp nur den Namen, etwa Gemma 4 E4B. Bietet LM Studio mehrere Varianten an, nimm die mit Recommended (Empfohlen), nie eine mit Likely too large (Wahrscheinlich zu groß für diesen Computer), und laut Doku mindestens eine 4-Bit-Variante, also Q4 oder höher.
Der Download ist der langsamste Teil. App (569 MB auf dem Mac, 618 MB unter Windows, Stand 17. September 2026) und Gemma 4 E4B (5,90 GB) brauchen bei 100 Mbit/s rechnerisch etwa 9 Minuten, bei 50 Mbit/s etwa 18. Unter 100 Mbit/s nimmst du deshalb auch mit 16 GB Arbeitsspeicher Qwen3.5 4B (3,75 GB, mit App bei 50 Mbit/s rechnerisch etwa 12 Minuten) und liest während des Downloads Stufe 2.
Schritt 4: Modell laden, WLAN aus
Ist der Download fertig, wechsle in der Seitenleiste zu Chat. Klick oben auf Select a model to load (Modell zum Laden auswählen) oder drück Cmd/Strg + L und wähl dein Modell. LM Studio reserviert dafür laut Dokumentation Arbeitsspeicher. Danach kommt der Beweis: Schalte das WLAN aus oder zieh das Netzwerkkabel.
Schritt 5: Der Starter-Prompt
Ersetz im Starter-Prompt die Angaben in eckigen Klammern und schick ihn im Chat ab.
Eine gute Antwort hat Betreffzeile, förmliche Anrede, zwei oder drei kurze Absätze mit deinem Termin, Grußformel und Platzhalter, ohne Vorrede wie “Hier ist dein Brief”. Prüf vor allem Namen und Daten, kleine Modelle übernehmen sie nicht immer exakt. Stimmt etwas nicht, schreib: “Übernimm Namen und Daten exakt aus meiner ersten Nachricht und gib mir nur den korrigierten Brief.”
Kopier den Brief in den Windows-Editor oder in TextEdit (dort vorher Format > In reinen Text umwandeln, Apple-Hilfe) und speichere ihn als brief.txt. Das ist dein erstes Ergebnis: ein Brief, den eine KI auf deinem eigenen Rechner ohne Internetverbindung geschrieben hat.
Stufe 2: Fortgeschritten, das richtige Modell und deine eigenen Dokumente
Welches Modell zu deinem Rechner passt
Der nötige Arbeitsspeicher auf den Modellseiten entspricht fast genau der Dateigröße: Qwen3.8 27B hat 16,10 GB und braucht 16 GB, Metas Muse Glimmer 25,77 GB und 26 GB. Betriebssystem und Browser wollen daneben Platz, plan also Luft ein.
| Arbeitsspeicher | Mac mit Apple-Chip | Windows-PC | Modelle zur Auswahl (Download) |
|---|---|---|---|
| 8 GB | geht laut LM Studio, nur kleine Modelle und kurzer Kontext | unter der Empfehlung, nur kleine Modelle | Granite 4.1 3B (2,10 GB), Qwen3.5 4B (3,75 GB), Gemma 4 E2B (4,20 GB) |
| 16 GB | empfohlene Ausstattung | empfohlen, dazu 4 GB eigener Grafikspeicher | Gemma 4 E4B (5,90 GB), Ministral 3 8B (6,50 GB), Qwen3.5 9B (7,00 GB) |
| 32 GB | Platz für mittelgroße Modelle | ebenso, Grafikkarte hilft | gpt-oss-20b (12,00 GB), Gemma 4 26B A4B (15,60 GB), Qwen3.8 27B (16,10 GB) |
Quellen: Systemanforderungen und die Modellseiten zu Granite 4.1, Qwen3.5, Gemma 4, Ministral 3, gpt-oss, Qwen3.8 und Muse Glimmer, abgerufen am 17. September 2026.
Auf dem Mac gibt es neben GGUF oft MLX, das LM Studio laut Doku nur auf Macs mit Apple-Chip ausführt. Passt ein Modell ganz in den Grafikspeicher, steht in der Download-Liste Full GPU Offload Possible (Vollständiges GPU-Offloading möglich), was laut App-Hinweis deutlich beschleunigen kann. Dein Tempo misst du selbst: Starter-Prompt an zwei Modelle aus deiner Zeile, Zeit bis zum letzten Wort stoppen.
Dokumente befragen, ohne sie hochzuladen
Laut Dokumentation hängst du PDF-, DOCX- und TXT-Dateien an eine Nachricht an, per Drag-and-drop oder über Attach File. Laut Offline-Doku bleibt das Dokument dabei auf deinem Rechner. Kurze Dokumente liest das Modell komplett, aus langen fischt LM Studio passende Ausschnitte heraus, was laut Hersteller nicht immer auf Anhieb klappt. Ein App-Hinweis nennt bis zu 5 Dateien mit zusammen höchstens 30 MB. Tipp aus der Doku: Nenn Wörter, die im Dokument stehen dürften, also “Kündigungsfrist” statt “Wie komme ich raus?”.
Die drei Fehler, die dir garantiert begegnen
Fehler 1: Das Modell lädt nicht. Symptom: “Not enough resources to load the model with the current settings”. Ursache: Modell und Gesprächsspeicher passen nicht in den freien Arbeitsspeicher. Lösung: ein kleineres Modell nehmen, in der Tabelle oben also eines aus der Zeile über deiner, oder Programme schließen. Erzwingen ließe sich das Laden mit gedrückter Alt- oder Option-Taste, laut App-Warnung kann der Rechner dabei aber einfrieren.
Fehler 2: Die Suche findet nichts mehr. Symptom: Die Modellsuche funktioniert nicht, neue Modelle lassen sich nicht herunterladen. Ursache: Das WLAN aus Stufe 1 ist noch aus, und laut Offline-Doku fragt die Suche unter anderem bei huggingface.co an, Suche und Downloads brauchen also Internet. Lösung: WLAN an, Modell herunterladen, WLAN wieder aus.
Fehler 3: Die Antwort klingt sicher, stimmt aber nicht. Symptom: Das Modell nennt eine Frist oder Zahl, die im Dokument nicht vorkommt. Ursache: Ein kleines Modell füllt Lücken mit Plausiblem. Lösung: Verlang wie im Dokument-Prompt ein wörtliches Zitat und such es im Original. Ohne Zitat ist es eine Vermutung.
Stufe 3: Experte, deine lokale KI dauerhaft einrichten
Ein fester Assistent per System-Prompt
Damit du Regeln nicht in jeden Chat kopierst, gibt es das Feld Set system prompt (System-Prompt festlegen). Siehst du es nicht, schalte in den Einstellungen unter Developer (Entwickler) den Developer Mode ein, der laut Release Notes alle erweiterten Optionen zeigt. Speicherst du den System-Prompt als Preset, wählst du ihn in jedem neuen Chat wieder aus.
Chats exportieren
Über das Menü ••• eines Chats und Export speicherst du das Gespräch laut Release Notes als PDF, Markdown oder reinen Text.
Andere Programme anschließen
Manche Programme sprechen statt einer Cloud-KI einen lokalen Server an. Dafür schaltest du laut Server-Doku im Bereich Developer (Entwickler) den Schalter Start server ein. Im Browser zeigt http://localhost:1234/v1/models dann laut API-Doku deine Modelle als JSON. Lass Serve on Local Network (Im lokalen Netzwerk bereitstellen) aus, dann erreicht nur dein eigener Rechner den Server.
Ehrliche Grenzen
- Qualität: Gemma 4 E4B hat laut Modellseite 8 Milliarden Parameter, davon 4,5 Milliarden effektiv, das Cloud-Modell GLM-5.3 im selben Modellkatalog 753 Milliarden, davon 40 Milliarden aktiv. Für lange Analysen, knifflige Logik und aktuelles Wissen bleibt die Cloud im Vorteil.
- Was trotzdem ins Netz geht: Laut Datenschutzerklärung sendet die App beim Update-Check App-Version, Betriebssystem und IP-Adresse, bei der Modellsuche anonymisierte Suchanfragen. Inhalte von Chats und Dokumenten verarbeitet der Hersteller nur, wenn du Cloud-Funktionen kaufst und nutzt, und dann laut eigener Angabe, ohne sie zu speichern.
- Lizenz im Job: Die Nutzungsbedingungen erlauben persönliche und interne geschäftliche Zwecke, nicht aber LM Studio als Dienst für Dritte. Modelle haben eigene Lizenzen, Gemma 4, Qwen3.5 und gpt-oss laut Modellseiten Apache 2.0. Ob das die Datenschutzpflichten deines Betriebs erfüllt, klärst du intern, dies ist keine Rechtsberatung.
LM Studio oder Ollama
Ollama ist der Weg fürs Terminal: Du installierst Ollama von ollama.com/download, danach lädt und startet der Befehl ollama run gemma4 das Modell Gemma 4 in einem Schritt, lokal laut Preisseite ebenfalls für 0 USD. Die Ollama-Bibliothek nennt für gemma4:e4b allerdings 9,6 GB statt 5,90 GB, die Größe prüfst du also dort.
Häufige Fragen zu lokaler KI mit LM Studio
Ist LM Studio kostenlos, auch für die Arbeit?
Ja. Seit Juli 2025 ist LM Studio laut Hersteller privat und im Job kostenlos, ohne Lizenzanfrage. Kostenpflichtig sind laut Preisseite die optionalen Cloud-Tarife der Agenten-App Bionic: Bionic+ für 20 USD und Pro für 100 USD pro Monat. Für lokale KI brauchst du keinen davon.
Wie viel RAM braucht eine lokale KI?
16 GB empfiehlt LM Studio für Mac und Windows. Auf einem Mac mit 8 GB geht es laut Systemanforderungen nur mit kleineren Modellen und kurzem Kontext, etwa Qwen3.5 4B mit 3,75 GB laut Modellseite.
Läuft LM Studio auf einem Intel-Mac?
Nein. LM Studio verlangt laut Systemanforderungen einen Apple-Chip, Intel-Macs werden derzeit nicht unterstützt.
Funktioniert eine lokale KI wirklich ohne Internet?
Ja, sobald das Modell auf der Festplatte liegt. Chat, Dokumente und lokaler Server laufen laut Dokumentation offline. Internet brauchst du nur für Modellsuche, Downloads, neue Laufzeiten und App-Updates.
Brauche ich eine Grafikkarte für lokale KI?
Nein. Für Windows empfiehlt LM Studio 4 GB eigenen Grafikspeicher, verlangt ihn aber nicht.
LM Studio oder Ollama, was ist besser für Anfänger?
LM Studio, wenn du Modelle in einem Programmfenster suchen, vergleichen und laden willst. Ollama hat laut Schnellstart inzwischen ebenfalls eine App, seine Stärke ist aber der Befehl im Terminal. Beide betreiben Modelle lokal für 0 USD.
Ist eine lokale KI so gut wie ChatGPT?
Nein, nicht auf einem normalen Rechner. Modelle, die in 16 GB passen, haben einen Bruchteil der Parameter großer Cloud-Modelle. Für Briefe und Fragen an eigene Dokumente reicht das, wenn du die Ergebnisse prüfst.
Dein nächster Schritt
Die Regel hinter diesem Tutorial: Lokal lohnt sich, wo der Inhalt heikler ist als die Aufgabe schwer. Verträge, Briefe und Notizen über Menschen bleiben auf deinem Rechner, anspruchsvolle Aufgaben mit harmlosen Daten gibst du an die Cloud.
Deine erste lokale KI ist 20 Minuten entfernt. Lade LM Studio unter lmstudio.ai/download herunter.
- Dein erstes Transkript mit Whisper: Whisper macht aus Aufnahmen offline Text, LM Studio fasst das Transkript danach lokal zusammen.
- Dein erster ChatGPT-Prompt, der funktioniert: Die Prompt-Regeln von dort gelten auch lokal, und gerade kleine Modelle brauchen klare Vorgaben.
- Deine erste Sprachsteuerung ohne Cloud: dieselbe Idee, ein Schritt weiter. Ein lokales Modell schaltet in Home Assistant dein Licht, und kein gesprochenes Wort verlässt dein Haus.
- Den Terminal-Weg zu lokalen Modellen zeigt die Ollama-Toolseite.
- Systemanforderungen, Bionic-Tarife und Alternativen stehen auf der LM-Studio-Toolseite.
Wie gut kennst du lokale KI mit LM Studio?
10 Fragen, von den Systemanforderungen bis zur Lizenz im Job. Wer mindestens 8 richtig beantwortet, bekommt ein Zertifikat zum Teilen.