Zum Inhalt springen
Anfänger ⏱ Gesamt 60 Min. 🔨 LM Studio 🔨 Ollama

Deine erste lokale KI mit LM Studio: offline und ohne Konto, in 20 Minuten

Dein Ziel nach diesem Tutorial:

Du startest heute noch deine erste lokale KI, die ohne Internet auf deinem Rechner antwortet

Kurzfazit: Für alle, die KI nutzen wollen, ohne ihre Texte in die Cloud zu schicken. Mit LM Studio und dem freien Modell Gemma 4 E4B oder Qwen3.5 4B schreibt dir nach 20 Minuten eine lokale KI den ersten Brief, bei ausgeschaltetem WLAN und ohne Konto. App und Modell kosten 0 USD, auch im Job. Die Grenze ist dein Rechner: Mac mit Apple-Chip oder Windows-PC mit AVX2, empfohlen sind 16 GB Arbeitsspeicher. Und lokal bleibt die KI schwächer als große Cloud-Modelle.

Alles, was du in einen Cloud-Chatbot tippst, geht an die Server des Anbieters: die Antwort an den Vermieter, die Frage zum Arztbrief. Bei einer lokalen KI liegt das Modell als Datei auf deiner Festplatte, und laut LM-Studio-Dokumentation verlässt nichts, was du im Chat eingibst, dein Gerät. Die 20 Minuten sind Stufe 1, die 60 Minuten die ganze Anleitung.

Was das kostet

BausteinPreisEhrliche Grenze
LM Studio (App)0 USD, privat und im JobKein Open Source, Lizenz nur für persönliche und interne geschäftliche Zwecke
Modell Gemma 4 E4B oder Qwen3.5 4B0 USD, Lizenz Apache 2.05,90 GB beziehungsweise 3,75 GB, die beim Laden in deinen Arbeitsspeicher passen müssen
Dein Rechner0 USD, wenn er passtMac mit Apple-Chip ab macOS 14, Windows mit AVX2 oder Snapdragon X Elite, 16 GB RAM empfohlen
LM Studio Bionic+ (optional)20 USD pro MonatNicht nötig: Cloud-Modelle auf US-Servern, also gerade nicht offline

Quellen: Nutzungsbedingungen (Fassung vom 23. August 2026), Systemanforderungen, Gemma-4-Modellseite, Qwen3.5-Modellseite und Preisseite, abgerufen am 17. September 2026. Kostenlos im Job ist LM Studio laut Hersteller-Blog seit Juli 2025. Die Grenze, die hier zählt, ist dein Arbeitsspeicher.


Stufe 1: Anfänger, deine erste Offline-KI in 20 Minuten

Was du brauchst

  • Einen Mac mit Apple-Chip (M1 oder neuer) und macOS 14 oder neuer, oder einen Windows-PC mit x64-Prozessor mit AVX2 oder mit Snapdragon X Elite
  • 16 GB Arbeitsspeicher empfiehlt LM Studio, ein Mac mit 8 GB reicht laut Systemanforderungen für kleine Modelle
  • Freien Speicherplatz für die App und das Modell, das allein 3,75 GB oder 5,90 GB belegt (siehe Schritt 3)
  • Internet nur für die Downloads, ein Konto verlangt die Einstiegsanleitung nicht

Menünamen stehen hier auf Englisch und in Klammern auf Deutsch, beide aus den Übersetzungsdateien von LM Studio.

Schritt 1: Prüfen, ob dein Rechner passt

Auf dem Mac wählst du im Apple-Menü Über diesen Mac und siehst unter Chip, ob ein Apple-Chip verbaut ist (Apple-Hilfe). Steht dort stattdessen Prozessor mit einem Intel-Namen, hörst du hier auf: Intel-Macs unterstützt LM Studio derzeit nicht. Deinen Arbeitsspeicher zeigt die App Aktivitätsanzeige unter Speicher als Physischer Speicher (Apple-Hilfe). Unter Windows öffnest du Einstellungen, System und Info, unter Gerätespezifikationen stehen Prozessor und RAM (Microsoft-Hilfe). Ob der Prozessor AVX2 beherrscht, steht auf der Produktseite des Herstellers.

Schritt 2: LM Studio installieren

Öffne lmstudio.ai/download. Ganz oben steht LM Studio Bionic, laut Hersteller eine eigene Agenten-App. Du scrollst weiter zu Download LM Studio (am 17. September 2026 Version 0.4.24), lädst die Fassung für dein System und installierst sie.

Schritt 3: Das passende Modell herunterladen

Starte LM Studio. Eine Einführung überspringst du mit Skip onboarding (Onboarding überspringen). Die Modellsuche öffnest du laut Release Notes 0.4.0 über das Lupen-Symbol oben rechts oder mit Cmd/Strg + Shift + M. Je nach Version heißt der Einstieg Discover (Entdecken), laut Dokumentation mit Cmd/Strg + 2. Tipp den Suchbegriff ein, der zu deinem Arbeitsspeicher passt:

Dein ArbeitsspeicherModell für Stufe 1SuchbegriffDownload
8 GBQwen3.5 4Bqwen/qwen3.5-4b3,75 GB
16 GB oder mehrGemma 4 E4Bgoogle/gemma-4-e4b5,90 GB

Größen laut Modellseiten zu Qwen3.5 und Gemma 4. Findet die Suche nichts, tipp nur den Namen, etwa Gemma 4 E4B. Bietet LM Studio mehrere Varianten an, nimm die mit Recommended (Empfohlen), nie eine mit Likely too large (Wahrscheinlich zu groß für diesen Computer), und laut Doku mindestens eine 4-Bit-Variante, also Q4 oder höher.

Der Download ist der langsamste Teil. App (569 MB auf dem Mac, 618 MB unter Windows, Stand 17. September 2026) und Gemma 4 E4B (5,90 GB) brauchen bei 100 Mbit/s rechnerisch etwa 9 Minuten, bei 50 Mbit/s etwa 18. Unter 100 Mbit/s nimmst du deshalb auch mit 16 GB Arbeitsspeicher Qwen3.5 4B (3,75 GB, mit App bei 50 Mbit/s rechnerisch etwa 12 Minuten) und liest während des Downloads Stufe 2.

Schritt 4: Modell laden, WLAN aus

Ist der Download fertig, wechsle in der Seitenleiste zu Chat. Klick oben auf Select a model to load (Modell zum Laden auswählen) oder drück Cmd/Strg + L und wähl dein Modell. LM Studio reserviert dafür laut Dokumentation Arbeitsspeicher. Danach kommt der Beweis: Schalte das WLAN aus oder zieh das Netzwerkkabel.

Schritt 5: Der Starter-Prompt

Ersetz im Starter-Prompt die Angaben in eckigen Klammern und schick ihn im Chat ab.

Starter-Prompt: dein erster Brief, offline geschrieben
Schreib mir einen kurzen, sachlichen Brief an [meinen Vermieter, Herrn Beispiel]. Anlass: [Die Heizung in meiner Wohnung fällt seit dem 10. September immer wieder aus.] Mein Ziel: [Eine Reparatur bis zum 30. September.] Vorgaben: - auf Deutsch, höchstens 150 Wörter - höflich, aber bestimmt - mit Betreffzeile und förmlicher Anrede - Datum, Adressen und Unterschrift als Platzhalter in eckigen Klammern - keine Paragrafen, Gesetze oder Urteile, die ich nicht selbst genannt habe Gib mir nur den fertigen Brief, ohne Einleitung und ohne Erklärung.
Funktioniert mit LM Studio mit Gemma 4 E4B oder Qwen3.5 4B

Eine gute Antwort hat Betreffzeile, förmliche Anrede, zwei oder drei kurze Absätze mit deinem Termin, Grußformel und Platzhalter, ohne Vorrede wie “Hier ist dein Brief”. Prüf vor allem Namen und Daten, kleine Modelle übernehmen sie nicht immer exakt. Stimmt etwas nicht, schreib: “Übernimm Namen und Daten exakt aus meiner ersten Nachricht und gib mir nur den korrigierten Brief.”

Kopier den Brief in den Windows-Editor oder in TextEdit (dort vorher Format > In reinen Text umwandeln, Apple-Hilfe) und speichere ihn als brief.txt. Das ist dein erstes Ergebnis: ein Brief, den eine KI auf deinem eigenen Rechner ohne Internetverbindung geschrieben hat.


Stufe 2: Fortgeschritten, das richtige Modell und deine eigenen Dokumente

Welches Modell zu deinem Rechner passt

Der nötige Arbeitsspeicher auf den Modellseiten entspricht fast genau der Dateigröße: Qwen3.8 27B hat 16,10 GB und braucht 16 GB, Metas Muse Glimmer 25,77 GB und 26 GB. Betriebssystem und Browser wollen daneben Platz, plan also Luft ein.

ArbeitsspeicherMac mit Apple-ChipWindows-PCModelle zur Auswahl (Download)
8 GBgeht laut LM Studio, nur kleine Modelle und kurzer Kontextunter der Empfehlung, nur kleine ModelleGranite 4.1 3B (2,10 GB), Qwen3.5 4B (3,75 GB), Gemma 4 E2B (4,20 GB)
16 GBempfohlene Ausstattungempfohlen, dazu 4 GB eigener GrafikspeicherGemma 4 E4B (5,90 GB), Ministral 3 8B (6,50 GB), Qwen3.5 9B (7,00 GB)
32 GBPlatz für mittelgroße Modelleebenso, Grafikkarte hilftgpt-oss-20b (12,00 GB), Gemma 4 26B A4B (15,60 GB), Qwen3.8 27B (16,10 GB)

Quellen: Systemanforderungen und die Modellseiten zu Granite 4.1, Qwen3.5, Gemma 4, Ministral 3, gpt-oss, Qwen3.8 und Muse Glimmer, abgerufen am 17. September 2026.

Auf dem Mac gibt es neben GGUF oft MLX, das LM Studio laut Doku nur auf Macs mit Apple-Chip ausführt. Passt ein Modell ganz in den Grafikspeicher, steht in der Download-Liste Full GPU Offload Possible (Vollständiges GPU-Offloading möglich), was laut App-Hinweis deutlich beschleunigen kann. Dein Tempo misst du selbst: Starter-Prompt an zwei Modelle aus deiner Zeile, Zeit bis zum letzten Wort stoppen.

Dokumente befragen, ohne sie hochzuladen

Laut Dokumentation hängst du PDF-, DOCX- und TXT-Dateien an eine Nachricht an, per Drag-and-drop oder über Attach File. Laut Offline-Doku bleibt das Dokument dabei auf deinem Rechner. Kurze Dokumente liest das Modell komplett, aus langen fischt LM Studio passende Ausschnitte heraus, was laut Hersteller nicht immer auf Anhieb klappt. Ein App-Hinweis nennt bis zu 5 Dateien mit zusammen höchstens 30 MB. Tipp aus der Doku: Nenn Wörter, die im Dokument stehen dürften, also “Kündigungsfrist” statt “Wie komme ich raus?”.

Dokument-Prompt: Fragen an deinen eigenen Vertrag
Beantworte meine Fragen ausschließlich anhand des angehängten Dokuments [Mietvertrag.pdf]. Regeln: - Steht die Antwort nicht im Dokument, schreib "Steht nicht im Dokument" und rate nicht. - Nenne zu jeder Antwort den Abschnitt, aus dem sie stammt, und zitiere den entscheidenden Satz wörtlich. - Höchstens zwei Sätze pro Antwort, dazu das Zitat. Fragen: 1. [Welche Kündigungsfrist gilt für mich als Mieter?] 2. [Wer zahlt Kleinreparaturen, und bis zu welchem Betrag?] 3. [Was steht zur Haltung von Haustieren?] Antworte als nummerierte Liste in der Reihenfolge meiner Fragen.
Funktioniert mit LM Studio, Dokument an die Nachricht angehängt

Die drei Fehler, die dir garantiert begegnen

Fehler 1: Das Modell lädt nicht. Symptom: “Not enough resources to load the model with the current settings”. Ursache: Modell und Gesprächsspeicher passen nicht in den freien Arbeitsspeicher. Lösung: ein kleineres Modell nehmen, in der Tabelle oben also eines aus der Zeile über deiner, oder Programme schließen. Erzwingen ließe sich das Laden mit gedrückter Alt- oder Option-Taste, laut App-Warnung kann der Rechner dabei aber einfrieren.

Fehler 2: Die Suche findet nichts mehr. Symptom: Die Modellsuche funktioniert nicht, neue Modelle lassen sich nicht herunterladen. Ursache: Das WLAN aus Stufe 1 ist noch aus, und laut Offline-Doku fragt die Suche unter anderem bei huggingface.co an, Suche und Downloads brauchen also Internet. Lösung: WLAN an, Modell herunterladen, WLAN wieder aus.

Fehler 3: Die Antwort klingt sicher, stimmt aber nicht. Symptom: Das Modell nennt eine Frist oder Zahl, die im Dokument nicht vorkommt. Ursache: Ein kleines Modell füllt Lücken mit Plausiblem. Lösung: Verlang wie im Dokument-Prompt ein wörtliches Zitat und such es im Original. Ohne Zitat ist es eine Vermutung.


Stufe 3: Experte, deine lokale KI dauerhaft einrichten

Ein fester Assistent per System-Prompt

Damit du Regeln nicht in jeden Chat kopierst, gibt es das Feld Set system prompt (System-Prompt festlegen). Siehst du es nicht, schalte in den Einstellungen unter Developer (Entwickler) den Developer Mode ein, der laut Release Notes alle erweiterten Optionen zeigt. Speicherst du den System-Prompt als Preset, wählst du ihn in jedem neuen Chat wieder aus.

System-Prompt: dein privater Offline-Assistent
Du bist mein privater Assistent und läufst komplett offline auf meinem Rechner. Regeln: 1. Antworte immer auf Deutsch und in der Du-Form. 2. Halte Antworten unter [150] Wörtern, außer ich bitte ausdrücklich um mehr. 3. Du hast keinen Internetzugang. Bei aktuellen Preisen, Nachrichten oder Gesetzen weist du darauf hin, dass dein Wissen veraltet sein kann. 4. Weißt du etwas nicht sicher, schreib "Das weiß ich nicht sicher" statt zu raten. 5. Mein Schwerpunkt ist [Briefe und Behördenpost]. Entwürfe gibst du als fertigen Text ohne Vorrede aus.
Funktioniert mit LM Studio, Feld Set system prompt

Chats exportieren

Über das Menü ••• eines Chats und Export speicherst du das Gespräch laut Release Notes als PDF, Markdown oder reinen Text.

Andere Programme anschließen

Manche Programme sprechen statt einer Cloud-KI einen lokalen Server an. Dafür schaltest du laut Server-Doku im Bereich Developer (Entwickler) den Schalter Start server ein. Im Browser zeigt http://localhost:1234/v1/models dann laut API-Doku deine Modelle als JSON. Lass Serve on Local Network (Im lokalen Netzwerk bereitstellen) aus, dann erreicht nur dein eigener Rechner den Server.

Ehrliche Grenzen

  • Qualität: Gemma 4 E4B hat laut Modellseite 8 Milliarden Parameter, davon 4,5 Milliarden effektiv, das Cloud-Modell GLM-5.3 im selben Modellkatalog 753 Milliarden, davon 40 Milliarden aktiv. Für lange Analysen, knifflige Logik und aktuelles Wissen bleibt die Cloud im Vorteil.
  • Was trotzdem ins Netz geht: Laut Datenschutzerklärung sendet die App beim Update-Check App-Version, Betriebssystem und IP-Adresse, bei der Modellsuche anonymisierte Suchanfragen. Inhalte von Chats und Dokumenten verarbeitet der Hersteller nur, wenn du Cloud-Funktionen kaufst und nutzt, und dann laut eigener Angabe, ohne sie zu speichern.
  • Lizenz im Job: Die Nutzungsbedingungen erlauben persönliche und interne geschäftliche Zwecke, nicht aber LM Studio als Dienst für Dritte. Modelle haben eigene Lizenzen, Gemma 4, Qwen3.5 und gpt-oss laut Modellseiten Apache 2.0. Ob das die Datenschutzpflichten deines Betriebs erfüllt, klärst du intern, dies ist keine Rechtsberatung.

LM Studio oder Ollama

Ollama ist der Weg fürs Terminal: Du installierst Ollama von ollama.com/download, danach lädt und startet der Befehl ollama run gemma4 das Modell Gemma 4 in einem Schritt, lokal laut Preisseite ebenfalls für 0 USD. Die Ollama-Bibliothek nennt für gemma4:e4b allerdings 9,6 GB statt 5,90 GB, die Größe prüfst du also dort.


Häufige Fragen zu lokaler KI mit LM Studio

Ist LM Studio kostenlos, auch für die Arbeit?

Ja. Seit Juli 2025 ist LM Studio laut Hersteller privat und im Job kostenlos, ohne Lizenzanfrage. Kostenpflichtig sind laut Preisseite die optionalen Cloud-Tarife der Agenten-App Bionic: Bionic+ für 20 USD und Pro für 100 USD pro Monat. Für lokale KI brauchst du keinen davon.

Wie viel RAM braucht eine lokale KI?

16 GB empfiehlt LM Studio für Mac und Windows. Auf einem Mac mit 8 GB geht es laut Systemanforderungen nur mit kleineren Modellen und kurzem Kontext, etwa Qwen3.5 4B mit 3,75 GB laut Modellseite.

Läuft LM Studio auf einem Intel-Mac?

Nein. LM Studio verlangt laut Systemanforderungen einen Apple-Chip, Intel-Macs werden derzeit nicht unterstützt.

Funktioniert eine lokale KI wirklich ohne Internet?

Ja, sobald das Modell auf der Festplatte liegt. Chat, Dokumente und lokaler Server laufen laut Dokumentation offline. Internet brauchst du nur für Modellsuche, Downloads, neue Laufzeiten und App-Updates.

Brauche ich eine Grafikkarte für lokale KI?

Nein. Für Windows empfiehlt LM Studio 4 GB eigenen Grafikspeicher, verlangt ihn aber nicht.

LM Studio oder Ollama, was ist besser für Anfänger?

LM Studio, wenn du Modelle in einem Programmfenster suchen, vergleichen und laden willst. Ollama hat laut Schnellstart inzwischen ebenfalls eine App, seine Stärke ist aber der Befehl im Terminal. Beide betreiben Modelle lokal für 0 USD.

Ist eine lokale KI so gut wie ChatGPT?

Nein, nicht auf einem normalen Rechner. Modelle, die in 16 GB passen, haben einen Bruchteil der Parameter großer Cloud-Modelle. Für Briefe und Fragen an eigene Dokumente reicht das, wenn du die Ergebnisse prüfst.


Dein nächster Schritt

Die Regel hinter diesem Tutorial: Lokal lohnt sich, wo der Inhalt heikler ist als die Aufgabe schwer. Verträge, Briefe und Notizen über Menschen bleiben auf deinem Rechner, anspruchsvolle Aufgaben mit harmlosen Daten gibst du an die Cloud.

Deine erste lokale KI ist 20 Minuten entfernt. Lade LM Studio unter lmstudio.ai/download herunter.


Wie gut kennst du lokale KI mit LM Studio?

10 Fragen, von den Systemanforderungen bis zur Lizenz im Job. Wer mindestens 8 richtig beantwortet, bekommt ein Zertifikat zum Teilen.

LM-Studio-Quiz
1 / 10

Welche Macs unterstützt LM Studio laut Systemanforderungen?

Für Unternehmen

Du willst das für dein Team?

Alleine brauchst du dafür 60 Minuten. Mit deinem Team wird daraus ein Training: dieselben Werkzeuge, aber eure Aufgaben, eure Daten, eure Fragen. Im kostenlosen Erstgespräch, 30 Minuten, sagen wir dir ehrlich, ob Beratung, ein Training oder ein Projekt der nächste sinnvolle Schritt ist. Oder ob gerade keiner nötig ist.

KI-Training anfragen

Kostenlos, jeden Freitag

KI-Wochenbriefing: jeden Freitag KI-News, Praxistipps und Tools

Kostenlos abonnieren, jederzeit abmeldbar, kein Spam.

Tutorial teilen: