Lokale KI auf deinem Laptop: Dein erster eigener KI-Dienst

Ein KI-Modell auf deinem Laptop beantwortet deine Frage ganz ohne Internetverbindung. Anschließend beantwortet es dieselbe Frage für eine zweite App auf demselben Rechner – ohne dass du etwas umstellen musst. So wird aus dem Laptop, den du bereits nutzt, ein kleiner, persönlicher KI-Dienst, den andere Apps und Skripte aufrufen können.

Du lädst ein fertiges Modell herunter und führst es aus, statt selbst eines zu trainieren. Falls du noch nicht geprüft hast, ob dein Laptop dafür genug RAM oder VRAM hat, lies zuerst wie viel RAM dein Laptop für lokale KI braucht. Weißt du bereits, dass dein Gerät die Anforderungen erfüllt, kannst du direkt weiterlesen.

Vier Ebenen: So ist ein lokales KI-Setup aufgebaut

Ein lokales KI-Setup lässt sich in vier getrennte Ebenen unterteilen – die vierte ist optional. Wenn du sie auseinanderhältst, kannst du die nächsten Schritte leichter nachvollziehen.

Modellgewichte werden als Datei heruntergeladen – zum Beispiel als 3,4 GB große, quantisierte Version eines kleinen Modells. Die 3,4 GB geben an, wie viel Platz die Datei auf deinem Laufwerk belegt – nicht, wie viel RAM das Modell im Betrieb braucht.

Die Inferenz-Engine ist das Programm, das die Modellgewichte lädt und Anfragen beantwortet. Hier übernimmt Ollama diese Aufgabe und stellt eine lokale HTTP-API bereit. So können andere Apps deinen Laptop als KI-Dienst nutzen.

Das Frontend schickt die Anfrage ab und entscheidet, ob der Prompt auf deinem Laptop bleibt oder anderswohin gesendet wird. Das kann Ollamas integrierter Chat sein, ein kurzes Skript oder eine separate App.

Ein optionaler Dokumentenindex lässt das Chatmodell deine eigenen Dateien durchsuchen. Dafür brauchst du ein separates Embedding-Modell und einen eigenen Speicherbereich. Der Index wird nicht automatisch angelegt und ist nicht Thema dieser Anleitung.

Kurz gesagt: Eine App oder ein Skript ruft 127.0.0.1:11434 auf. Dort nimmt Ollama die Anfrage entgegen und lädt das Modell, das du heruntergeladen hast. Löschst du das Modell, bleibt der gespeicherte Chatverlauf eines Frontends erhalten – er ist an einem anderen Ort gespeichert.

Vor der Installation: Ist dein Laptop ähnlich ausgestattet wie eines dieser beiden Modelle?

Nimm dir vor der Installation zwei Minuten Zeit und notiere dir die wichtigsten Daten deines Laptops: RAM-Größe, Betriebssystem, Prozessor und den freien Speicherplatz auf der SSD. Hat er dedizierten Grafikspeicher (VRAM), halte auch dessen Größe fest. Wie viel RAM und VRAM lokale KI braucht und warum, erfährst du im Ratgeber wie viel RAM dein Laptop für lokale KI braucht.

Diese beiden Laptops sind aktuell bei refurbed erhältlich. Beide sind refurbished: Sie wurden professionell getestet, gereinigt und wiederaufbereitet. Für beide gilt eine Garantie von 12 Monaten. Das eine gehört zu Apples Einstiegsmodellen mit Apple Silicon, das andere ist ein Windows-Laptop mit dediziertem Grafikspeicher. Mit beiden kannst du alle weiteren Schritte durchführen.

Ollama auf macOS, Windows oder Linux installieren

Unter macOS oder Windows lädst du die offizielle Ollama-App herunter. Unter Linux folgst du der Installationsanleitung von Ollama. Starte Ollama nach der Installation einmal. Falls unter Linux noch kein Ollama-Dienst Anfragen entgegennimmt, führe ollama serve aus.

Mit der aktuellen App kannst du Modelle lokal ausführen oder Cloud-Optionen nutzen. Wähle dabei den Tag eines heruntergeladenen lokalen Modells. Für die lokale Inferenz musst du dich nicht anmelden.

Für diese Anleitung lädst du das Modell qwen3.5:4b-q4_K_M herunter. Der Download ist 3,4 GB groß. Der konkrete Modell-Tag ist wichtig: Die allgemeine Bezeichnung „latest“ kann unbemerkt auf ein deutlich größeres Modell verweisen als das, mit dem du getestet hast. Die 3,4 GB geben die Dateigröße auf dem Laufwerk an. Wie viel RAM das Modell beim Beantworten von Anfragen braucht, lässt sich daraus nicht ablesen.

So lädst du dein erstes Modell herunter und startest den ersten Chat

Für den ersten Chat mit dem Modell genügen zwei Befehle:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Der erste Befehl lädt das Modell herunter, mit dem zweiten öffnest du einen interaktiven Chat. Gib dem Modell statt einer allgemeinen Begrüßung eine kleine, konkrete Aufgabe, zum Beispiel: „Mach aus diesen drei Besprechungsnotizen eine Aufgabenliste. Erfinde keine Datumsangaben.“

Wenn du fertig bist, gib /bye ein, um den Chat zu beenden.

Die KI läuft jetzt lokal auf deinem Laptop: So rufst du die API auf

Im Terminal kommuniziert das Chat-Frontend mit der Engine. Jetzt rufst du die Engine direkt auf – so wie eine andere App.

Unter macOS oder Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Unter Windows mit PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'

Den Antworttext findest du im Feld message.content. Wenn du stream auf false setzt, erhältst du die vollständige Antwort auf einmal statt in einzelnen Teilen. Mit num_ctx: 4096 hältst du den Kontext für den ersten Test überschaubar; das beworbene Maximum des Modells liegt deutlich höher.

Was dir die Antwort über die Geschwindigkeit verrät

Neben dem Antworttext unter message.content liefert Ollama weitere Angaben, mit denen du die Geschwindigkeit einordnen kannst: load_duration, prompt_eval_count, prompt_eval_duration, eval_count und eval_duration.

Die Felder zeigen dir, wie lange das Laden des Modells in den Arbeitsspeicher oder den Grafikspeicher und die Antwortgenerierung jeweils dauern. Eine einzelne Angabe in „Tokens pro Sekunde“ unterscheidet diese beiden Schritte nicht. Die erste Anfrage nach dem Start von Ollama dauert meist am längsten, weil das Modell erst geladen werden muss. Bei der nächsten Anfrage entfällt diese Ladezeit.

Konkrete Messwerte hängen ganz von deinem Laptop ab. Deshalb nennen wir hier keine Zahlen als typische Werte. Vergleiche lieber die Werte aus zwei Durchläufen auf demselben Laptop, statt dich auf eine einzelne Geschwindigkeitsangabe zu verlassen.

Modelle prüfen: ps, ls und automatisches Entladen bei Inaktivität

Mit drei Befehlen prüfst du geladene Modelle, listest Downloads auf und löschst Modelle, die du nicht mehr brauchst.

ollama ps zeigt, welche Modelle gerade geladen sind und auf welcher Hardware sie laufen. In der Prozessorspalte siehst du 100 % GPU, 100 % CPU oder eine Aufteilung zwischen beiden.

ollama ls listet alle heruntergeladenen Modelle auf.

ollama rm qwen3.5:4b-q4_K_M löscht ein heruntergeladenes Modell, das du nicht mehr brauchst.

Standardmäßig entlädt Ollama ein Modell nach fünf Minuten Inaktivität. Wenn ollama ps kein geladenes Modell anzeigt, schick zuerst eine neue Anfrage, bevor du einen Fehler vermutest.

So verbindest du eine zweite App über die lokale OpenAI-kompatible API

Jetzt stellt dein Laptop das Modell auch einer zweiten App bereit. Dafür verbindest du sie mit Ollama auf demselben Rechner statt mit einem Cloud-Dienst.

Bei den meisten Apps, in denen du einen OpenAI-kompatiblen Endpunkt selbst eintragen kannst, brauchst du drei Angaben: Basis-URL, Modellname und API-Schlüssel. Trage http://localhost:11434/v1/ als Basis-URL und qwen3.5:4b-q4_K_M als Modellnamen ein.

Manche Apps akzeptieren beim API-Schlüssel kein leeres Feld. Die Ollama-Dokumentation verwendet deshalb den Platzhalter api_key='ollama' und stellt klar: Der lokale Server verlangt einen nicht leeren Eintrag, prüft den Wert aber nicht. Die Zeichenfolge authentifiziert nichts – sie ist kein Passwort, sondern füllt nur ein Formularfeld aus.

Die OpenAI-Kompatibilität umfasst nur einen Teil der jeweiligen API. Teste deshalb jede Funktion, die du nutzen möchtest, mit deiner App – etwa Bildeingaben oder Tool-Calling. Verlass dich nicht darauf, dass alle Funktionen unterstützt werden.

Bleibt dein KI-Dienst lokal? Offline testen und Zugriff begrenzen

Eine Antwort in der zweiten App beweist noch nicht, dass sie vom lokalen Modell kommt. Sobald das Modell vollständig heruntergeladen ist, schalte das WLAN deines Laptops aus oder zieh das Netzwerkkabel. Wiederhole dann die vorherige Anfrage über die eben verbundene App. Bekommst du ohne Internetverbindung eine Antwort vom heruntergeladenen Modell, kommt sie nicht aus dem Internet.

Eine Antwort, die nur online funktioniert, zählt nicht. Ebenso wenig zählen ein Aufruf von https://ollama.com statt localhost, der Tag eines Cloud-Modells oder ein unbemerkter Cloud-Fallback. Ollamas lokale Modellanfragen bleiben auf deinem Laptop; seine separaten Cloud-Modelle laufen über einen gehosteten Dienst.

Der Offline-Test zeigt, woher die Antwort kommt – er ersetzt aber keine Zugriffssicherung. Standardmäßig nimmt Ollama Anfragen nur unter 127.0.0.1:11434 entgegen und ist damit nur von deinem Laptop aus erreichbar. Lass diese Einstellung unverändert. Der zuvor eingetragene Platzhalter api_key='ollama' ist keine Authentifizierung: Der lokale Server prüft seinen Wert nicht. Setze OLLAMA_HOST=0.0.0.0 nicht und leite Port 11434 nicht ins öffentliche Internet weiter. Ist der Port öffentlich erreichbar, können andere auf den ungeschützten Dienst zugreifen.

Wenn du Ollamas eigene Cloud-Funktionen ganz abschalten möchtest, trage {"disable_ollama_cloud": true} in ~/.ollama/server.json ein oder setze OLLAMA_NO_CLOUD=1. Starte Ollama danach neu, damit die Änderung wirksam wird. Das ist optional: Der Tag eines heruntergeladenen lokalen Modells ist bereits eine Entscheidung für die lokale Ausführung.

Der Zugriff aus einem anderen Zimmer oder von einem anderen Gerät ist ein eigener, anspruchsvollerer Schritt. Dafür brauchst du ein privates Netzwerk und einen vorgeschalteten Proxy mit Authentifizierung. Das behandeln wir hier nicht; den Port direkt freizugeben, ist dafür keine Lösung.

Zwei Apps gleichzeitig: Reicht der Speicher?

Wenn der integrierte Chat und die verbundene App jeweils für sich funktionieren, schicke über beide gleichzeitig eine Anfrage. Erst damit prüfst du, ob dein Laptop auch überlappende Anfragen bedienen kann.

Parallele Anfragen brauchen zusätzlichen Speicher. Der Bedarf wächst grob mit der Zahl gleichzeitiger Anfragen × der eingestellten Kontextlänge. Zum laufenden Speicherbedarf gehören außerdem die geladenen Modellgewichte, der KV-Cache, Arbeitsbereich und andere geöffnete Apps.

Bleib zunächst bei num_ctx: 4096 aus dem API-Test. Wird der Speicher bei überlappenden Anfragen knapp, starte sie zeitlich versetzt oder reduziere die Zahl paralleler Anfragen. Dass dein Laptop jede App einzeln bedienen kann, heißt noch nicht, dass er beide zugleich bedienen kann.

Wenn etwas nicht klappt

Hier findest du die häufigsten Probleme und erfährst, was du zuerst prüfen kannst.

Verbindung verweigert. Schau nach, ob die Ollama-App oder ollama serve läuft, und versuche es erneut.

Die erste Antwort dauert länger als die folgenden. Das liegt am Laden des Modells, nicht an der Geschwindigkeit der Antwortgenerierung. An den zuvor genannten Feldern der Antwort erkennst du den Unterschied.

Alles wirkt deutlich langsamer als erwartet. Mit ollama ps siehst du, ob das Modell nur auf der CPU oder auf CPU und GPU läuft. Prüfe außerdem, ob deine GPU und die zugehörigen Treiber unter deinem Betriebssystem unterstützt werden.

Wenig freier Arbeitsspeicher oder Abstürze. Nutze den Tag eines kleineren Modells, reduziere num_ctx und schließe andere speicherhungrige Apps. Versuche es dann erneut.

Der Speicherplatz wird knapp. Mit ollama ls siehst du, welche Modelle heruntergeladen sind. Ungenutzte Modelle entfernst du mit ollama rm.

Passt dieses Setup nicht zu dir, etwa weil du Modelle in einer grafischen Oberfläche durchstöbern oder CPU und GPU feiner steuern möchtest, schau dir stattdessen LM Studio oder llama.cpp an. Das spricht für einen Wechsel der Engine – nicht dafür, zwei Setups parallel zu betreiben.

Häufige Fragen zur lokalen KI auf dem Laptop

Brauche ich nach der Einrichtung noch Internet? Nein. Sobald das Modell vollständig heruntergeladen ist, kannst du mit ihm chatten und es über die API ansprechen – beides ohne Internetverbindung.

Schützt der Platzhalter-API-Schlüssel meinen Endpunkt? Nein. Ollamas lokaler Server akzeptiert jeden nicht leeren Wert, ohne ihn zu prüfen. Der Schlüssel, den manche Apps verlangen, ist deshalb keine Sicherheitsmaßnahme.

Bleibt mein Prompt auf meinem Laptop? Ja, wenn du den Tag eines heruntergeladenen lokalen Modells nutzt. Ollama bietet auch separate Cloud-Modelle an, die über einen gehosteten Dienst laufen. Ob dein Prompt auf dem Laptop bleibt, hängt also vom gewählten Modell-Tag ab – nicht von einer versteckten Voreinstellung.

Brauche ich eine dedizierte Grafikkarte? Nein. Auch allein mit der CPU kann dein Laptop ein kleines Modell ausführen – in der Regel langsamer. Mit ollama ps siehst du, ob die CPU, die GPU oder beide deine Anfrage verarbeitet haben.

Wie nutze ich ein größeres oder anderes Modell? Prüfe zuerst RAM und VRAM. Dann ersetzt du in den Befehlen ollama pull und ollama run den Modell-Tag. Die Hintergründe erfährst du im Ratgeber „Wie viel RAM dein Laptop für lokale KI braucht“.

Merkt sich das Modell meine Dokumente ab jetzt dauerhaft? Nein. Ein Chatmodell speichert den Inhalt eines Ordners nicht von selbst dauerhaft. Um eigene Dateien zu durchsuchen, brauchst du einen separaten Dokumentenindex. Diese optionale Einrichtung behandeln wir hier nicht.

Jetzt bist du dran: So setzt du deinen eigenen KI-Dienst ein

Such dir eine echte Aufgabe aus und bearbeite sie auf beiden Wegen: im integrierten Chat und in der zweiten App, die du eben verbunden hast. Du könntest eine persönliche Notiz zusammenfassen, mehrere Dateien in benannte Gruppen sortieren oder dir einen kurzen Codeausschnitt in einfachen Worten erklären lassen.

Welche Aufgabe du auch wählst: Notiere dir den genauen Modell-Tag, die Engine-Version, die Kontexteinstellung, die URL und die Aufgabe selbst. Damit lässt sich das Ergebnis später reproduzieren – von dir oder von anderen, die dasselbe ausprobieren.

Hat sich gezeigt, dass dein Laptop für dieses Setup zu wenig RAM oder VRAM hat, ist ein Gerät mit mehr Reserven eine Überlegung wert. Im nächsten Teil der Reihe zeigen wir dir, wie du dir eine kleine Auswahl an Modellen zusammenstellst: eines für Chats, eines für Code und eines für die Suche.

Refurbished Laptop für lokale KI, erhältlich bei refurbed

Erstmals zum Newsletter anmelden, 15 € sparen!

Verpasse kein Angebot mehr.

Informationen über die Verwendung personenbezogener Daten findest du in unserer Datenschutzerklärung.