Wie viel RAM braucht dein Laptop für lokale KI?

Auf deinem eigenen Laptop kann ein kleines KI-Modell bereits Texte lesen, Bilder analysieren und deine Fragen beantworten, ganz ohne Cloud-Konto. Das Modell qwen3.5:4b-q4_K_M (Qwen) kann auf einem ganz normalen Laptop mit 16 GB Arbeitsspeicher genau das, wenn du dir heute Abend die 3,4 GB große Datei herunterlädst. Es ist ein LLM, also ein großes Sprachmodell. Lade das Modell mit Ollama, stell ihm eine Frage mit 4K-Kontext, und schon läuft ein echtes KI-Modell lokal auf der Hardware, die du bereits besitzt. Es verarbeitet Text und Bilder. Dabei geht es um Inferenz, nicht ums Training: Dem Modell wird nichts Neues beigebracht, es antwortet einfach.

Ein vager "AI PC"-Aufkleber auf dem Laptopkarton ist keine belastbare Spezifikation. Entscheidend sind RAM, der Speicher, den die GPU nutzen kann, Speicherplatz und echte Software-Unterstützung. 16 GB Arbeitsspeicher sind ein solider Einstieg für kleine KI-Modelle – kein Wert, den du gleich abschreiben solltest, aber auch kein Versprechen für alles, was ein Datenblatt bewirbt. Mehr Speicher bringt mehr Kontext und mehr Spielraum fürs Multitasking. Mit 16 GB kannst du loslegen.

Was beim Ausführen von KI den RAM deines Laptops wirklich belegt

Die Downloadgröße eines Modells und sein RAM-Bedarf während der Ausführung sind zwei verschiedene Dinge. Wer beides verwechselt, macht einen der häufigsten Fehler beim Laptopkauf für KI. Die 3,4 GB von qwen3.5:4b-q4_K_M sind die Datei auf der SSD. Zum Laden braucht das Modell Arbeitsspeicher. Das gilt auch für das Kontextfenster: den laufenden Gesprächsverlauf, den das Modell während der Antwort im Speicher hält, den sogenannten KV-Cache. Dazu kommen die Engine selbst und alles, was dein Betriebssystem und andere Apps bereits belegen.

Ollama lädt standardmäßig einen Kontext von 4.096 Tokens; du kannst ihn aber erhöhen. Laufen mehrere Anfragen gleichzeitig, steigt der Speicherbedarf für den Kontext grob mit der Zahl der parallelen Anfragen. Auf dem Datenblatt eines Modells stehen vielleicht 128K oder 256K Tokens Kontextfenster. Das ist die Obergrenze des Modells – keine Zusage, dass dein 16-GB-Laptop all das gleichzeitig stemmen kann.

RAM, VRAM und Unified Memory sind nicht dasselbe

Apple-Silicon-Chips nutzen Unified Memory: CPU und GPU greifen auf einen gemeinsamen Pool von 16, 24 oder 32 GB zu. Separaten Grafikspeicher, der knapp werden kann, gibt es dabei nicht. Ein typischer Windows- oder Linux-Laptop mit dedizierter NVIDIA-GPU funktioniert anders. System-RAM und der eigene VRAM der GPU sind zwei getrennte Speicherpools. 16 GB Arbeitsspeicher plus eine 8-GB-GPU ergeben daher nicht einfach einen frei nutzbaren 24-GB-Pool für ein Modell.

Wenn ein Modell nicht vollständig auf die GPU passt, läuft ein Teil davon stattdessen auf der CPU. Dieses teilweise Offloading kann ein Modell spürbar ausbremsen, obwohl es sich technisch noch laden lässt. Mit ollama ps siehst du die CPU/GPU-Aufteilung für alles, was gerade geladen ist.

Kapazität ist nur die halbe Geschichte. Genauso wichtig ist, wie schnell sich der Speicher ansprechen lässt: Apple nennt 153 GB/s Speicherbandbreite für das MacBook Air M5. Auch diese Bandbreite – nicht nur die Speichergröße – ist ein Grund dafür, dass sich Unified Memory reaktionsschnell anfühlt und nicht bloß gerade so ausreicht.

Quantisierung: So passt ein 9B-KI-Modell in deinen RAM

Hinter dem 3,4-GB-Download steckt Quantisierung: Werden die Gewichte eines Modells mit geringerer numerischer Präzision gespeichert, schrumpft die Datei. Beim 9B-Modell von Qwen3.5 ist die Spanne besonders deutlich. Dasselbe 9B-Modell wird als Q4_K_M mit 6,6 GB heruntergeladen, als Q8_0 mit 11 GB und mit voller BF16-Präzision mit 19 GB. Dasselbe Modell, dieselbe Parameterzahl – aber drei sehr unterschiedliche Downloadgrößen. Und auch hier gilt: Das ist die Dateigröße, nicht der RAM-Bedarf während der Ausführung.

Geringere Präzision kostet in der Regel etwas Qualität. Wie viel genau, hängt von der Aufgabe ab, nicht von einem festen Prozentsatz. Bevor du Qwen als erstes Modell auswählst, ist noch etwas gut zu wissen: Manche Nutzer:innen berichten, dass der "Thinking"-Schritt eine spürbare Verzögerung erzeugt, bevor eine Antwort erscheint – verglichen mit Modellen, die direkter antworten. Probier beide Ansätze am besten mit deinen eigenen Aufgaben aus, statt anzunehmen, einer sei grundsätzlich besser.

Du hast schon ein 16-GB-MacBook? Probier zuerst das aus

Wenn du bereits ein MacBook mit 16 GB besitzt, starte mit einem 2-4B-Modell in Q4-Präzision und einem 4K-Kontext, bevor du überhaupt an einen Neukauf denkst. Ein 9B-Q4-Modell oder etwas wie Gemma 4 12B QAT könnte ebenfalls laufen. Ob das klappt, hängt davon ab, wie viele andere Apps geöffnet sind, wie viel Kontext du nutzt und wie warm das Gerät schon ist. Sieh es als sinnvollen Test, nicht als Garantie.

Du willst gezielt ein neues Gerät dafür kaufen? Das MacBook Air 13" mit M5-Chip kommt standardmäßig mit 16 GB Unified Memory und lässt sich auf bis zu 32 GB konfigurieren. Bevor dich der größere Bildschirm als Upgrade lockt, lohnt ein Blick auf den Speicher: Das 15-Zoll-M5-Air startet mit denselben Optionen von 16, 24 und 32 GB und derselben Bandbreite von 153 GB/s wie das 13-Zoll-Modell. Richte dich bei der Bildschirmgröße nach dem Komfort, nicht nach der Hoffnung auf mehr KI-Spielraum. Den gibt es hier nicht.

MacBook Air 13 Zoll mit M5-Chip

Du hast schon einen 16-GB-Laptop mit Windows oder Linux? Dann starte hier

Auch ein Windows- oder Linux-Laptop mit 16 GB und ohne dedizierte GPU kann ein kleines Modell ausführen. Ollama läuft nativ unter Windows: Lade ein 2-4B-Q4-Modell und probier es auf der CPU oder mit integrierter Grafik aus, bevor du Geld ausgibst. Rechne dabei mit größeren Unterschieden als bei Apple Silicon. Eine feste Zahl für Tokens pro Sekunde lässt sich nicht für jede Maschine angeben, weil nicht jede Konfiguration vermessen wurde.

Das Lenovo ThinkPad T14 G2 und das HP EliteBook x360 1040 G7 bieten beide 16 GB RAM mit integrierter Grafik und gehören damit genau in diese Klasse. Gerade bei einem älteren refurbished Gerät wie diesen beiden solltest du zuerst einen Punkt prüfen: LM Studio setzt unter Windows x64 AVX2-Unterstützung voraus, und nicht alle älteren CPUs beherrschen diesen Befehlssatz. Schau dir deshalb den konkreten Prozessor an, bevor du davon ausgehst, dass jeder Laptop in dieser Klasse das gewählte Tool ausführen kann.

Lenovo ThinkPad T14 G2 Laptop

Die Laptop-GPU-Falle: Warum "RTX 5070 Ti" nicht alles verrät

NVIDIAs Laptop-GPUs tragen dieselben Namen wie Desktop-Karten – und dieser Name verrät weniger, als du vielleicht denkst. Die RTX 5060 Laptop GPU bringt 8 GB GDDR7-Speicher und einen veröffentlichten Leistungsbereich von 45 bis 100 Watt mit. Die RTX 5070 Ti Laptop GPU bietet 12 GB GDDR7 und 60 bis 115 Watt. Ein Online-Ergebnis für eine Desktop-RTX-5070-Ti lässt sich also nicht einfach auf eine Laptop-RTX-5070-Ti übertragen, auch wenn der Name das nahelegt.

Im selben Namen steckt noch eine zweite Falle. Zwei Laptops können beide eine "RTX 5070 Ti Laptop GPU" haben und sich unter Dauerlast trotzdem unterschiedlich verhalten: Ein dünnes, leichtes Gehäuse und ein dickeres, schwereres Modell gehen unterschiedlich mit Wärme um. Derselbe GPU-Name garantiert daher nicht dieselbe Geschwindigkeit im Alltag, sobald die Lüfter eine Weile laufen. Schau dir immer die genaue VRAM-Angabe und die konkrete Leistungskonfiguration des Laptops an, nicht nur den Namen der GPU-Familie.

16 GB als Einstieg – mehr Speicher für regelmäßige lokale KI

16 GB bleiben ein sinnvoller Einstieg. Wenn du einen Laptop gezielt für regelmäßige lokale KI-Nutzung kaufst, bieten 24–32 GB Unified Memory bei Apple oder 32 GB System-RAM mit einer dedizierten NVIDIA-Laptop-GPU und mindestens 8 GB eigenem VRAM mehr Platz für größere Modelle, längeren Kontext und andere geöffnete Apps. Bei Apple sind 32 GB die Empfehlung, wenn du lokale KI häufig nutzt und dein Budget es zulässt. Unter Windows oder Linux kommen 12 GB VRAM infrage, wenn ein etwas schwererer oder teurerer Laptop für dich passt.

8 GB VRAM sind ein plausibles Ziel für 4–7B-Modelle in Q4-Präzision mit moderatem Kontext – aber kein automatischer Spielraum. Selbst der 6,6-GB-Download eines 9B-Q4-Modells kann für einen komfortablen Betrieb mehr als 8 GB VRAM benötigen. Mit 12 GB VRAM lassen sich 9B-Modelle leichter ausprobieren, ohne dass damit garantiert wäre, dass sie hineinpassen.

Zwei refurbished Geräte zeigen den Unterschied zwischen den Speicherarchitekturen: Das MacBook Pro 13" mit M2-Chip kombiniert eine CPU mit 8 Kernen und eine GPU mit 10 Kernen mit bis zu 24 GB Unified Memory. Sein Chip stammt aus einer älteren Generation als der im M5 Air; für das MacBook Pro gilt die 24-GB-Obergrenze, nicht die 24- und 32-GB-Konfigurationsoptionen des M5 Air. Beim Dell Precision 7730 stehen 32 GB System-RAM neben einer dedizierten NVIDIA Quadro P3200 mit eigenen 6 GB VRAM. Die Quadro gehört zu einer anderen GPU-Generation und -Klasse als NVIDIAs aktuelle RTX 5060 und 5070 Ti Laptop GPUs. Das Dell veranschaulicht damit getrennte Speicherpools – es ist kein Beispiel für die Empfehlung einer GPU mit mindestens 8 GB VRAM.

MacBook Pro 13 Zoll mit M2-Chip

Aktive Parameter sind nicht die ganze Rechnung

Wenn du einschätzt, ob dein Laptop ein Modell ausführen kann, lass dich nicht allein von der beworbenen Zahl aktiver Parameter leiten. Bei einem 26B/A4B-Mixture-of-Experts-Modell sind pro Token ungefähr 4B Parameter aktiv – die Gewichte des gesamten 26B-Modells müssen trotzdem gespeichert oder nachgeladen werden. Für die Speicherplanung ist es daher kein 4B-Modell.

Beim Gemma 4 E2B steckt eine andere Tücke im Namen: Das Modell hat 2,3B effektive Sprachparameter, aber 5,1B Parameter inklusive Embeddings. Sein Ollama-Download ist 7,2 GB groß – diese Dateigröße ist nicht der gesamte Speicherbedarf zur Laufzeit. Schau dir deshalb den exakten Modell-Tag, die Präzision, den verfügbaren Speicher und den geplanten Kontext an, statt einen Laptop allein nach einer Parameterzahl auszuwählen.

Eine interessante Alternative: AMD-Laptop-Chips mit viel Speicher

AMDs Ryzen-AI-Max+-395-Prozessor unterstützt je nach Konfiguration des fertigen Laptops bis zu 128 GB LPDDR5x-Arbeitsspeicher. Diese andere Speicherarchitektur ist einen Blick wert, hat aber einen Haken: In Ollamas Linux-ROCm-Supportliste taucht der Chip auf, in der Windows-ROCm-Liste aktuell nicht.

Das ist kein Grund, den Chip pauschal abzuschreiben. Bei einem konkreten Laptop solltest du aber den tatsächlich verbauten Speicher, das Betriebssystem, das GPU-Backend, den Treiber und das Verhalten mit Ollama genau prüfen, bevor du ihn empfiehlst. Ein AMD-Laptop mit viel Speicher ist eine interessante Alternativarchitektur, die sorgfältige Recherche verdient – kein automatischer Erstkauf für alle, die lokale KI gerade erst ausprobieren.

Die Software dahinter: Ollama und LM Studio klar erklärt

Ollama ist der einfachste Weg, ein Modell auf deinem eigenen Rechner zum Laufen zu bringen: Modell laden, starten – und schon antwortet ein lokaler Server auf Anfragen. Für ein heruntergeladenes Modell brauchst du dafür kein Cloud-Konto. Hinter allen Beispielen hier steckt genau dieses Tool.

LM Studio ist die grafische Alternative mit eigenem Modellbrowser und Chatfenster. Das Tool nennt auch seine Mindestanforderungen: mindestens 16 GB RAM auf Mac oder Windows, AVX2-Unterstützung unter Windows x64 und eine Empfehlung von 4 GB dediziertem VRAM unter Windows. Beide Werkzeuge sauber einzurichten, ist noch einmal ein eigenes Thema.

Bevor du einer einzelnen Geschwindigkeitsangabe im Netz vertraust, ist noch etwas wichtig: Das offizielle Tool llama-bench trennt die Geschwindigkeit der Prompt-Verarbeitung von der Generierungsgeschwindigkeit und zeigt Schwankungen über mehrere Durchläufe statt nur einer einzigen Zahl. Ein Forenbeitrag mit einer einzelnen Tokens-pro-Sekunde-Angabe verrät meist nicht, welcher der beiden Werte gemeint ist oder wie oft überhaupt gemessen wurde.

Checkliste für den Kauf oder das Upgrade eines KI-tauglichen Laptops

Wenn du gezielt für lokale KI kaufen oder aufrüsten willst, schau dir die konkreten Details an statt der Werbeversprechen.

Exaktes GPU-Modell und VRAM: Entscheidend sind nicht nur der Name der GPU-Familie, sondern die genaue Laptop-Variante und ihre konkrete Speicherausstattung. Hinter demselben Namen können unterschiedliche VRAM-Größen stecken.

Verlöteter oder aufrüstbarer RAM: Bei manchen Laptops kannst du später Speicher nachrüsten, bei vielen modernen dünnen und leichten Geräten nicht. Das solltest du vor dem Kauf wissen.

Freier SSD-Speicher: Modelldownloads reichen von unter einem Gigabyte bis deutlich über zehn. Eine wachsende Sammlung summiert sich neben deinen übrigen Dateien schnell.

Thermisches Verhalten unter Dauerlast: Ein Modell, das eine einzige Frage beantwortet, und ein Laptop, der mehrere Anfragen hintereinander bearbeitet, sind zwei verschiedene Tests. Lüftergeräusche und Drosselung nach wiederholten Prompts sagen mehr aus als eine einzelne kurze Demo.

OS- und Treiber-Support: Schau nach, ob Ollama oder LM Studio deine konkrete Kombination aus GPU-Backend und Betriebssystem unterstützt, statt einfach davon auszugehen.

Die NPU-TOPS-Zahl auf dem Karton ist keine Garantie für den Durchsatz. Sie ist ein Marketingwert, kein getestetes Ergebnis der Engine, die du tatsächlich nutzen wirst. Ein vages "AI PC"-Label ersetzt keine dieser Prüfungen.

Häufige Fragen zu KI auf dem Laptop

Brauche ich eine dedizierte GPU, um KI lokal auszuführen?

Nein. Ein kleines Modell läuft auf vielen 16-GB-Laptops auch auf der CPU oder mit integrierter Grafik. Bei der Geschwindigkeit gibt es dabei nur größere Unterschiede als auf einem Laptop mit dedizierter GPU. Starte mit einem 2-4B-Modell, bevor du davon ausgehst, dass du dedizierte Grafik brauchst.

Reichen 8 GB RAM aus?

Für die hier besprochenen Modelle nicht komfortabel. 16 GB sind der realistische Einstieg, wenn du berücksichtigst, dass sich Modell, Kontextfenster, Engine und Betriebssystem denselben Speicher teilen.

Ist die lokale Ausführung eines Modells dasselbe wie sein Training?

Nein. Alles oben ist Inferenz: Du stellst einem bereits trainierten Modell Fragen. Beim Training wird ein Modell von Grund auf aufgebaut. Dafür braucht es deutlich mehr Hardware als für alles, was hier vorgestellt wird.

Garantiert mehr RAM schnellere Antworten?

Nein. Mehr Speicher schafft Spielraum für größere Modelle, längeren Kontext und mehr geöffnete Apps. Die tatsächliche Geschwindigkeit hängt aber von Speicherbandbreite, GPU-Backend und dem konkreten Modell ab – nicht allein von der Speichergröße.

Bleiben meine Daten privat, wenn ein Modell lokal läuft?

Ja, in dem Sinn, dass deine Prompts auf deinem Rechner bleiben und nicht an einen Cloud-Anbieter gehen. Ollama bindet standardmäßig an deinen eigenen Laptop und sendet keine Anfragen an andere Orte, solange du nicht bewusst Cloud-Zugriff einrichtest.

Probier es heute aus – und kauf dann mit gutem Gewissen

Du hast schon einen 16-GB-Laptop? Installiere heute Abend Ollama und probier ein kleines Modell aus, bevor du auch nur einen Euro für etwas Neues ausgibst. Du willst gezielt dafür kaufen? Dann nutz die Checkliste oben und die fünf refurbished Laptops aus diesem Ratgeber als ersten Vergleich, statt dich auf ein Werbe-Datenblatt zu verlassen.

Jeder Laptop auf refurbed wird geprüft und bewertet, bevor er gelistet wird. Das heißt: Den RAM und die Konfiguration, die du kaufst, bekommst du auch. Im nächsten Ratgeber dieser Serie geht es darum, wie du deine erste App mit dem Modell verbindest, das du gerade ausprobiert hast.

Geöffnetes MacBook Air auf einem Schreibtisch, bereit für ein lokales KI-Modell

Erstmals zum Newsletter anmelden, 15 € sparen!

Verpasse kein Angebot mehr.

Informationen über die Verwendung personenbezogener Daten findest du in unserer Datenschutzerklärung.