Die besten kleinen KI-Modelle lokal nutzen: ein kompaktes Toolkit für deinen Laptop

Schon jetzt formuliert das qwen3.5:4b-q4_K_M auf einem ganz normalen Laptop mit 16 GB RAM Texte, erklärt Dinge und beantwortet alltägliche Fragen – ganz ohne Internetverbindung. Du kennst das Modell aus Teil 2 dieser Reihe. Als allgemeiner Assistent ist es eine solide Wahl. Für die Suche in deinen Dateien oder für Programmieraufgaben solltest du jedoch andere Modelle einsetzen. Wenn du für alles nur einen Download nutzt, verlangst du einem einzigen Modell zu viel ab. Sinnvoller sind drei kleine Modelle, die sich jeweils für ihre Aufgabe bewähren.

Wenn du deine lokale KI-Umgebung selbst bestimmst, entscheidest du bewusst, welches Modell und welche Laufzeitumgebung du nutzt, welche Lizenz gilt und welche Daten wo bleiben. Wenn du RAM und VRAM deines Laptops noch nicht geprüft hast, lies zuerst, wie viel RAM dein Laptop für lokale KI braucht. Falls du Ollama noch nicht installiert hast, zeigt dir die Anleitung zum Einrichten deines ersten lokalen KI-Providers, wie das geht. Hier setzen wir beides voraus und zeigen dir, welche Modelle sich lohnen und wie du herausfindest, ob sie etwas taugen.

Die besten kleinen KI-Modelle für den lokalen Einsatz – je nach Aufgabe

Für ein brauchbares lokales KI-Toolkit brauchst du drei Modelle für unterschiedliche Aufgaben – nicht eines für alles.

Ein allgemeiner Assistent für alltägliche Gespräche, Textentwürfe und kurze Fragen: qwen3.5:4b-q4_K_M. Der Download ist 3,4 GB groß; den Tag kennst du bereits aus Teil 2.

Ein kompaktes Spezialmodell für eng umrissene Aufgaben, etwa strukturierte Ausgaben oder logische Schlussfolgerungen nach festen Vorgaben: granite4.2:3b. Der Download ist 2,2 GB groß. Das Modell erschien im August 2026 und steht unter der Apache-2.0-Lizenz. Weitere Spezialmodelle für Code, Mathematik, Bildverarbeitung und Übersetzungen stellen wir in Abschnitt 6 vor. Je nach Aufgabe kannst du das Spezialmodell in deinem Toolkit durch eines davon ersetzen.

Ein Embedding-Modell für die Suche in deinen eigenen Dokumenten: embeddinggemma:300m. Der Download ist 622 MB groß. Mit diesem Modell kannst du nicht chatten – es wandelt stattdessen Text in Vektoren um, die eine Suchanwendung durchsucht. Wie das funktioniert, erklären wir ausführlich in Abschnitt 8.

Die drei Downloads belegen zusammen rund 6,2 GB auf der Festplatte. Daraus lässt sich ihr gemeinsamer Speicherbedarf im Betrieb nicht ablesen: Wenn alle drei Modelle gleichzeitig geladen sind, kann der freie Speicher deines Laptops trotzdem nicht ausreichen. Lade deshalb jeweils nur das passende Modell, teste es an einer echten Aufgabe und entferne Modelle, die sich nicht bewähren.

Quantisierung: was sich ändert und was nicht

Wie sich Quantisierung auswirkt, siehst du gut an Varianten desselben Modells. Bei Ollama ist das qwen3.5:9b-q4_K_M als Download 6,6 GB groß, das qwen3.5:9b-q8_0 11 GB und das qwen3.5:9b-bf16 19 GB. Die zugrunde liegenden Modellgewichte sind gleich, ihre Präzision und Downloadgröße unterscheiden sich.

Die Katalogangaben nennen die Downloadgröße. Wie viel Speicher die geladenen Modelle brauchen, lässt sich daraus nicht sicher ableiten. Geringere Präzision spart Platz auf der Festplatte und oft auch Speicher im Betrieb. Ob die Antwortqualität darunter leidet, hängt vom Modell, vom Quantisierungsverfahren und von der Aufgabe ab. Geh weder davon aus, dass die Antworten gleich gut bleiben, noch davon, dass die Ersparnis ohne Qualitätseinbußen zu haben ist.

Die geladenen Modellgewichte sind nur ein Teil des Speicherbedarfs. Auch das Kontextfenster mit seinem Key-Value-Cache und alles, was sonst noch läuft, brauchen freien Speicher. Quantisierung allein garantiert also nicht, dass ein größeres Modell in den Speicher passt. Mit der quantisierten Variante stehen die Chancen aber besser, als wenn du zuerst die Datei mit voller Präzision lädst.

Zwei Modellangaben, die zum falschen Download führen

Bei zwei Angaben im Modellkatalog zahlt sich ein genauer Blick aus – sonst lädst du leicht etwas anderes herunter als geplant.

Falle eins. Google nennt für das Gemma 4 E2B auf seiner Modellkarte 2,3 Milliarden „effektive“ Sprachparameter. Das klingt nach einer kleinen Datei. Der Download bei Ollama ist jedoch 7,2 GB groß – fast so groß wie der Q4-Tag gemma4:12b mit 7,6 GB. Wenn du prüfst, ob ein Modell auf deinem Laptop Platz hat, orientiere dich an der Downloadgröße, nicht an der Parameterzahl.

Falle zwei. Ohne genaue Modellangabe lädst du womöglich unbemerkt die falsche Variante herunter. Lädst du nur granite4.2 herunter, bekommst du das 8B-Modell mit 5,3 GB – nicht den 3B-Tag mit 2,2 GB aus Abschnitt 2. Mit dem bloßen Familiennamen qwen3-embedding bekommst du das 8B-Modell mit 4,7 GB statt des in Abschnitt 8 verwendeten 0,6B-Tags mit 639 MB.

In beiden Fällen gilt: Lade immer den vollständigen Modell-Tag herunter, nicht nur den Familiennamen. Schau dir außerdem die Downloadgröße an, bevor du annimmst, dass du die gewünschte Modellvariante testest.

Wie groß ist Ollamas Standard-Kontextfenster?

Im Katalog geben Werte wie 128K oder 256K Token an, wie viel Kontext ein Modell grundsätzlich verarbeiten kann. Ob dein Laptop mit 16 GB RAM dafür genug Speicher hat, lässt sich daraus nicht ablesen.

Ollama verwendet standardmäßig ein Kontextfenster von 4.096 Token. Du kannst es vergrößern, aber sowohl ein längerer Kontext als auch mehr parallele Anfragen erhöhen den Speicherbedarf. Die Einstellung num_ctx: 4096 aus Teil 2 der Reihe ist also nicht willkürlich gewählt: Sie entspricht diesem vorsichtigen Standardwert.

Starte ein neues Modell mit 4K bis 8K Token Kontext und nur einer aktiven Sitzung. Beobachte dabei, wie viel Arbeitsspeicher belegt ist. Vergrößere das Kontextfenster erst, wenn du gesehen hast, dass die Speicherbelegung stabil bleibt – nicht bloß, weil im Katalog ein höherer Wert steht.

Welches Spezialmodell bewährt sich bei deiner Aufgabe?

Bei der Wahl eines Spezialmodells zählt deine Aufgabe, nicht der Platz auf einer fremden Bestenliste. Diese Kandidaten kannst du mit denselben Aufgaben vergleichen – und nur behalten, was dir tatsächlich hilft.

Programmieren: Das qwen2.5-coder:3b (1,9 GB) und das größere qwen2.5-coder:7b (4,7 GB) stehen beide unter der Apache-2.0-Lizenz.

Mathe oder Logik mit klaren Vorgaben: Das phi4-mini:3.8b (2,5 GB) von Microsoft.

Fragen zu Bildern und Screenshots: Das gemma4:e2b (7,2 GB) und das gemma4:12b Q4 (7,6 GB) stehen beide unter der Apache-2.0-Lizenz. Laut Katalog nehmen beide Text und Bilder entgegen.

Mehrsprachiges Schreiben und Übersetzen: Das aya-expanse:8b (5,1 GB) wurde für 23 Sprachen entwickelt. Wichtig ist hier die Lizenz: Für das Aya Expanse 8B gilt CC-BY-NC-4.0 mit zusätzlichen Bedingungen für nicht kommerzielle Nutzung. Es ist daher kein uneingeschränkt nutzbares Standardmodell neben den Apache-lizenzierten Optionen. Falls keine dieser vier Spezialaufgaben zu deinem Vorhaben passt, bleibt das granite4.2:3b aus Abschnitt 2 die kompakte Wahl für allgemeine Aufgaben, die Schlussfolgerungen erfordern.

Ob ein Kandidat seinen Platz verdient, zeigen vier gemeinsame Textaufgaben mit deinem eigenen Material. Eine fünfte Aufgabe kommt nur für Modelle hinzu, die Bilder verarbeiten können.

1. Zusammenfassung mit Belegen: Gib jedem Modell dieselbe Notiz mit 250 Wörtern. Es soll drei konkrete Aufgaben ableiten und zu jeder den Satz nennen, auf dem sie beruht. Markiere Aussagen ohne Beleg in der Notiz.

2. Daten als JSON entnehmen: Erfinde fünf Termine mit Namen und Datumsangaben. Lass jedes Modell JSON mit genau den von dir vorgegebenen Feldern ausgeben und gleiche alle fünf Einträge mit deiner Vorlage ab.

3. Code reparieren: Gib allen Modellen dieselbe kleine fehlerhafte Funktion und einen Test, den sie nicht besteht. Prüfe, ob der Test nach der vorgeschlagenen Korrektur besteht; Repository und Kontext bleiben gleich.

4. Übersetzen zwischen zwei Sprachen: Lass eine Person, die beide Sprachen fließend beherrscht, bei einem realistischen Absatz prüfen, ob Namen, Zahlen und Nuancen erhalten bleiben. Beurteile mehrsprachige Qualität niemals allein anhand eines englischsprachigen Prompts.

5. Bildfrage, nur für kompatible Modelle: Zeige ein Diagramm oder einen Screenshot und stelle eine Frage mit überprüfbarer Antwort. Prüfe, ob das Bild selbst übertragen wurde und nicht bloß sein Dateiname.

Halte bei jedem Durchlauf fest, ob die Antwort mit der bekannten Lösung übereinstimmt, ob das Modell die Anweisungen befolgt und ob es Behauptungen erfindet. Notiere außerdem die Zeit bis zur ersten sichtbaren Ausgabe, die Gesamtdauer, die Tokenzahlen und ob das Modell auf CPU oder GPU lief. Bewerte Nutzen und Geschwindigkeit getrennt – auch Token für Schlussfolgerungen, die du nie siehst, kosten Zeit. Erst deine Ergebnisse zeigen, welches Modell sich für deine Aufgabe auszahlt.

Erst transkribieren, dann zusammenfassen: Whisper small als Option

Wenn deine Aufgabe mit einer Aufnahme beginnt, kann Whisper small sie lokal über whisper.cpp in Text umwandeln. Dafür nutzt du eine separate Spracherkennungs-Engine, kein weiteres Chatmodell.

Die Modelldatei belegt 466 MiB auf der Festplatte; der ungefähre Speicherbedarf im Betrieb liegt bei 852 MB. Die Dateigröße ist also nicht der Speicherbedarf beim Ausführen – wäge ab, ob sich dieser zusätzliche Schritt für deine Aufnahmen auszahlt.

Prüfe wichtige Namen und Zahlen anhand der Aufnahme. Wenn du eine Zusammenfassung möchtest, gib das geprüfte Transkript an deinen bisherigen Chat-Assistenten weiter. Whisper small ist eine optionale Ergänzung für Spracheingaben, kein verpflichtendes viertes Modell im Drei-Modell-Toolkit und kein ollama run-Tag.

Dokumente lokal durchsuchen: eine kleine RAG-Erweiterung

Das Embedding-Modell aus Abschnitt 2 hat eine Aufgabe: Es wandelt Text in Vektoren um, die eine Suchanwendung durchsuchen kann. Fragen beantwortet es nicht selbst.

Die Reihenfolge ist wichtig: Zuerst werden deine Dateien in Abschnitte aufgeteilt. Das Embedding-Modell wandelt jeden Abschnitt in einen Vektor um, der in einem lokalen Vektorspeicher abgelegt wird. Auch deine Suchanfrage wird in einen Vektor umgewandelt. Die Suche ruft die am besten passenden Abschnitte ab. Erst dann beantwortet ein Chatmodell deine Frage anhand der gefundenen Stellen und zitiert sie.

Das Chatmodell wurde nie mit deinen Dokumenten trainiert. Wenn du eine Frage stellst, bekommt es nur das zu sehen, was ihm die Suche in diesem Moment übergibt.

Ein kleiner Test zeigt dir ohne großen Einrichtungsaufwand, wie das funktioniert: Indexiere fünf Notizen, die du schon hast. Stell eine Frage, deren Antwort in einer der Notizen steht, und eine zweite, die sich mit keiner der fünf beantworten lässt. Funktioniert die Einrichtung, findet und zitiert das System bei der ersten Frage die passende Textstelle. Bei der zweiten weist es darauf hin, dass dafür ein Beleg fehlt, statt eine Antwort zu erfinden. Beurteile die Suchtreffer und die fertige Antwort getrennt.

Prüfe vor dem Download den vollständigen Tag des Embedding-Modells: embeddinggemma:300m oder qwen3-embedding:0.6b. Ein unvollständiger Tag kann wie in Abschnitt 4 zum falschen Download führen.

Warum weniger aktive Parameter nicht automatisch Speicherplatz sparen

Ein Modell mit einer Bezeichnung wie „26B A4B“ aktiviert für jedes erzeugte Token nur einen Teil seiner Parameter. Die vollständigen Gewichte des 26B-Modells müssen dennoch irgendwo gespeichert oder laufend eingelesen werden. Weniger aktive Parameter bedeuten deshalb nicht automatisch eine kleinere Datei oder einen geringeren Speicherbedarf im Betrieb.

Dieses Toolkit enthält keine neu gemessenen Benchmarkwerte. Zahlen aus anderen Quellen gelten nur für den jeweiligen Aufbau und die verwendete Hardware. So berichtet eine Person von rund 18,5 Token pro Sekunde bei einem ungewöhnlichen Testaufbau mit einem 26B-MoE-Modell, einer älteren CPU und einer GPU mit 6 GB VRAM. Für andere Modelle mit derselben Bezeichnung ist dieser Wert kein allgemeiner Richtwert.

Die Laptops, auf denen wir dieses Toolkit getestet haben

Wir haben das Toolkit auf zwei aktuellen Laptops getestet – denselben wie in Teil 2 dieser Reihe: einem Apple-Silicon-Einstiegsmodell und einer Windows-Workstation mit eigenem Grafikspeicher. Beide sind refurbished (professionell geprüft, gereinigt und wiederaufbereitet), und für beide gilt bei refurbed eine Garantie von zwölf Monaten. Beide können das Toolkit oben problemlos ausführen, ein Modell nach dem anderen.

Das MacBook Air (2026) mit 13 Zoll und M5-Chip hat standardmäßig 16 GB gemeinsam genutzten Speicher und lässt sich mit bis zu 32 GB konfigurieren. Das Dell Precision 7730 hat 32 GB Systemspeicher sowie 6 GB dedizierten NVIDIA-Grafikspeicher (VRAM). Die beiden Speicherbereiche sind getrennt und lassen sich nicht zu einem gemeinsamen Speicher zusammenfassen.

Die beiden Laptops sind hier keine Kaufempfehlung. Auf ihnen haben wir das Toolkit für diesen Ratgeber getestet. So kannst du deinen Laptop mit konkreter Hardware vergleichen statt mit einem Marketing-Datenblatt.

Refurbished Dell Precision 7730 als mobile Workstation

Lizenzen prüfen und die Modellauswahl klein halten

Eine Lizenz gilt für das jeweilige Modell, nicht pauschal für die Modellfamilie. Das Qwen3.5 4B, das Qwen2.5-Coder, das Granite 4.2 3B und das Gemma 4 E2B stehen unter der Apache-2.0-Lizenz. Für das Aya Expanse 8B gilt, wie in Abschnitt 6 erwähnt, CC-BY-NC-4.0 mit zusätzlichen Bedingungen für nicht kommerzielle Nutzung. Modellgewichte herunterladen zu können, eine urheberrechtliche Erlaubnis zu ihrer Nutzung zu haben und das zugrunde liegende Modell zu „besitzen“ – das sind drei verschiedene Dinge. Sieh dir deshalb die aktuelle Modellkarte zum vollständigen Tag des Modells an, das du herunterlädst, statt dich nur auf die Angaben zur Modellfamilie zu verlassen.

Einmal auswählen genügt nicht, damit dein Toolkit klein bleibt. Mit ollama rm entfernst du einen Download, der sich nicht bewährt hat, zum Beispiel mit ollama rm aya-expanse:8b, sobald du weißt, dass du dieses Modell nicht nutzen wirst. ollama ls zeigt dir, was tatsächlich auf der Festplatte liegt; ollama ps zeigt, was gerade geladen ist. Modellkataloge ändern sich. Geh deine Auswahl deshalb immer wieder durch, statt dich auf eine Entscheidung von vor Monaten zu verlassen.

Auch kleine Modelle können Textstellen erfinden, bei Übersetzungen Nuancen übersehen oder Code schreiben, der richtig aussieht und trotzdem einen Test nicht besteht. Betrachte jede Empfehlung hier als Ausgangspunkt für eigene Tests, nicht als Ersatz für eine fachliche Prüfung, wenn es darauf ankommt.

Die besten kleinen KI-Modelle lokal nutzen: häufige Fragen

Kann ich alle drei Modelle des Toolkits gleichzeitig ausführen? Auf einem Laptop mit 16 GB RAM läuft das wahrscheinlich nicht ohne Engpässe. Lade jeweils das Modell für deine aktuelle Aufgabe und wechsle danach, statt den allgemeinen Assistenten, das Spezialmodell und das Embedding-Modell gleichzeitig im Speicher zu halten.

Brauche ich für das Embedding-Modell eine GPU? Nein. embeddinggemma:300m ist klein genug, um es allein auf der CPU zu testen. Miss trotzdem die Laufzeit, statt mit einer sofortigen Verarbeitung zu rechnen.

Liefert ein größeres Modell immer die bessere Antwort? Nein. Ob ein 4B- oder ein 9B-Modell besser abschneidet, hängt von der Aufgabe ab. Deshalb setzt Abschnitt 7 auf fünf Tests statt auf eine einzige Zahl aus einer Bestenliste.

Reicht ein Q4-Download aus? Das hängt von der Aufgabe ab. Wenn dein Laptop genug Speicher hat, um beide Varianten auszuführen, vergleiche einen Q4-Tag mit dem entsprechenden Q8-Tag in drei eigenen Tests, wie in Abschnitt 3 beschrieben.

Kann ich Aya Expanse für ein kommerzielles Projekt nutzen? Nicht ohne Weiteres. Die CC-BY-NC-4.0-Lizenz deckt die nicht kommerzielle Nutzung ab; hinzu kommen weitere Bedingungen. Prüfe die aktuelle Modellkarte, bevor du davon ausgehst, dass eine kommerzielle Nutzung erlaubt ist.

Braucht das Embedding-Modell nach dem Download eine Internetverbindung? Nein. Sobald die Modellgewichte auf der Festplatte liegen, läuft es wie alle anderen Modelle in diesem Toolkit offline.

Jetzt bist du dran: Installiere die Modelle, teste sie und behalte, was sich bewährt

Installiere den 4B-Assistenten und ein Spezialmodell, das zu einer deiner Aufgaben passt. Nutze dafür den Laptop, dessen Speicherbedarf du in Teil 1 eingeschätzt und den du in Teil 2 eingerichtet hast. Teste beide Modelle mit drei eigenen Fragen nach dem Muster aus Abschnitt 7. Behalte das Modell, das dir hilft; das andere entfernst du mit ollama rm. Über den Kauf von zusätzlichem Speicher solltest du erst nachdenken, wenn du bei einer konkreten Aufgabe feststellst, dass der vorhandene Speicher der Engpass ist – nicht allein aufgrund eines Datenblatts.

Damit endet unsere dreiteilige Reihe. Falls dein Laptop zunächst mehr Speicher braucht, ist die Laptop-Kategorie ein sinnvoller Ausgangspunkt.

Geöffnetes refurbished MacBook Air auf einem Schreibtisch, bereit für ein kleines lokales KI-Toolkit

Erstmals zum Newsletter anmelden, 15 € sparen!

Verpasse kein Angebot mehr.

Informationen über die Verwendung personenbezogener Daten findest du in unserer Datenschutzerklärung.