Die gute Nachricht zuerst: Fast jeder Rechner der letzten Jahre kann eine lokale KI ausführen, und es hat schon etwas, wenn sie zum ersten Mal auf dem eigenen Schreibtisch antwortet. Die andere Hälfte: Nicht ausführen kann er die, die Sie heute benutzen. Auf einer 8-GB-Grafikkarte passen neben einem achtseitigen deutschen Dokument 4 der 20 Modelle, die wir vermessen, und das größte davon wiegt 4,64 GiB; das größte in unserem Katalog wiegt 433,83 GiB. Auf Englisch wären es an derselben Karte 6 Modelle — und genau dieser eine Unterschied ist die halbe Geschichte dieser Seite.
Das ist also kein Grund, es zu lassen. Es ist der Grund, vorher zu wissen, was Sie eintauschen.
Was sich wirklich ändert, wenn das Modell auf Ihrem Rechner läuft
Vier Dinge ändern sich, und nur vier.
Nichts, was Sie tippen, verlässt den Rechner. Weder das Dokument noch die Frage noch der Entwurf, den Sie am Ende doch nicht abgeschickt haben. Kein Auftragsverarbeitungsvertrag, keine Klausel zur Drittlandübermittlung, kein «Nicht mit meinen Daten trainieren»-Häkchen, auf das man einfach vertrauen muss. Für alles, was unter die DSGVO fällt, verkleinert das den Vorgang nicht: es lässt ihn entfallen.
Die Kosten sind nicht mehr nutzungsabhängig. Sie zahlen einmal Gerät und Strom. Kein Taxameter tickt mit, während Sie einen langen Vertrag einfügen und fünfmal die Zusammenfassung anfordern.
Es funktioniert ohne Netz. Sobald die Datei auf der Platte liegt, sind Flugzeug, Baustellenbüro oder ein abgeschottetes Firmennetz kein Hindernis mehr.
Und es ist kleiner und langsamer als das, was Sie gewohnt sind. Genau das steht nie neben dem Preis, also stellt der Rest dieser Seite Zahlen daneben.
Wie wir zählen, vor jeder Zahl
Alle Zahlen hier verwenden eine Kompression je Modell: Q4_K_M, wo der Autor sie veröffentlicht, sonst die nächstliegende. Q4_K_M ist unsere Qualitätsuntergrenze, denn darunter ist der Verlust in den Antworten hörbar.
Um wie viel kleiner, genau
Ein lokales Modell ist eine Datei, und sie muss in den Speicher passen, der übrig bleibt, nachdem das System sich seinen Teil genommen hat — gleichzeitig mit dem Speicher für den Gesprächsverlauf und dem Arbeitsspielraum des Programms. Wir reservieren 0,8 GiB auf dedizierten Grafikkarten und 3 GiB bei vereinheitlichtem oder Systemspeicher. Bei den PCs mit Ryzen AI Max+ gilt eine andere Grenze: AMD lässt die GPU höchstens 96 GiB von 128 GB und 160 GiB von 192 GB nutzen.
Bei einem Dokument von 4.000 Wörtern auf Deutsch:
| Rechner | Speicher fürs Modell | Passt auf Deutsch | Größtes | Gewicht | Abstand zu glm-5.2 |
|---|---|---|---|---|---|
| PC mit RTX 4060 8 GB | 7,20 GiB | 4 von 20 | gemma4-e4b |
4,64 GiB | ×94 |
| PC mit RTX 3060 12 GB | 11,20 GiB | 7 von 20 | gemma4-12b |
6,63 GiB | ×65 |
| PC mit RTX 4070 12 GB | 11,20 GiB | 7 von 20 | gemma4-12b |
6,63 GiB | ×65 |
| Mac mit M4 und 16 GB | 13,00 GiB | 8 von 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Bürolaptop, 16 GB, ohne Grafikkarte | 13,00 GiB | 8 von 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Mac mini mit M6 und 16 GB | 13,00 GiB | 8 von 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Mac mit M4 Pro und 24 GB | 21,00 GiB | 13 von 20 | qwen3-coder-30b |
17,28 GiB | ×25 |
| Station mit RTX 4090 24 GB | 23,20 GiB | 15 von 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mini-PC mit NPU und 32 GB | 29,00 GiB | 15 von 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mac mini mit M6 und 32 GB | 29,00 GiB | 15 von 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Server 2× RTX 3090 (48 GB) | 47,20 GiB | 15 von 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mac mit M4 Max und 64 GB | 61,00 GiB | 16 von 20 | gpt-oss-120b |
58,46 GiB | ×7 |
| Mac mini mit M5 Pro und 64 GB | 61,00 GiB | 16 von 20 | gpt-oss-120b |
58,46 GiB | ×7 |
| Xiaomi AI Cube, 80 GB (Prototyp) | 77,00 GiB | 17 von 20 | llama4-scout-17b |
60,87 GiB | ×7 |
| PC mit Ryzen AI Max+ 395 und 128 GB | 96,00 GiB | 18 von 20 | qwen3.8-flash-next |
87,25 GiB | ×5 |
| Mac Studio mit M5 Max und 128 GB | 125,00 GiB | 18 von 20 | qwen3.8-flash-next |
87,25 GiB | ×5 |
| PC mit Ryzen AI Max+ PRO 495 und 192 GB | 160,00 GiB | 19 von 20 | deepseek-v4-flash |
127,28 GiB | ×3 |
| Mac Studio mit M5 Ultra und 512 GB | 509,00 GiB | 20 von 20 | glm-5.2 |
433,83 GiB | ×1 |
Berechnet von Local AI Scope aus den veröffentlichten Dateigrößen und dem realen Attention-Muster jedes Modells, alle Zeilen bei derselben Referenzkompression, damit die Größen vergleichbar sind. Die Größen stammen aus den von den Autoren veröffentlichten Fassungen: glm-5.2, gemma4-12b, mistral-small-24b. glm-5.2 wiegt 433,83 GiB in Q4_K_M; die am wenigsten komprimierte Fassung, die wir katalogisieren (Q8_0), wiegt 746,32 GiB.
Die Leiter holt den Abstand erst ganz oben ein: ein Mac mit 64 GB, nun wirklich keine billige Maschine, bleibt 7 Mal darunter, mit 128 GB sind es immer noch 5, mit 192 GB 3, und die einzige Maschine der Liste, die 20 von 20 erreicht, ist der Mac Studio mit M5 Ultra und 512 GB.
Mac Studio mit M5 Ultra und 512 GB Unified MemoryHardware-Datenblatt

Warum Deutsch teurer ist
Der Kontext wird in Tokens reserviert, und derselbe Text ergibt nicht in jeder Sprache gleich viele Tokens. Gemessen mit dem eigenen Tokenizer jedes Modells über ein eigenes paralleles Korpus (sha256[:16] 2f6c96b6ea0b161f), hier der Median-Aufschlag gegenüber Englisch über 20 Modelle:
| Textsorte | Spanisch | Französisch | Deutsch |
|---|---|---|---|
| Vertrag, juristisches Dokument | ×1,16 | ×1,23 | ×1,36 |
| E-Mail, interne Notiz | ×1,12 | ×1,22 | ×1,21 |
| Support-Ticket | ×1,24 | ×1,40 | ×1,32 |
| Kommentierter Code | ×1,20 | ×1,31 | ×1,46 |
Mediane, gemessen von Local AI Scope an 20 Modellen. Bei Verträgen reicht der Faktor je nach Modell von ×1,25 bis ×1,76, bei Code von ×1,39 bis ×1,68.
Bei Verträgen und bei Code ist Deutsch die teuerste der vier Sprachen. Bei Support-Tickets ist es Französisch. Bei kurzen E-Mails ist der Unterschied so klein, dass er nichts entscheidet.
Der Aufschlag bleibt aber nicht abstrakt: irgendwann kostet er ein Modell. In Schritten von 100 Wörtern gemessen, ab welcher Länge auf demselben Rechner auf Deutsch weniger Modelle passen als auf Englisch:
| Rechner | Deutsch | Spanisch | Französisch |
|---|---|---|---|
| PC mit RTX 4060 8 GB | 2.800 Wörter | 4.200 | 4.200 |
| Mac mit M4 Pro und 24 GB | 3.700 Wörter | 5.200 | 5.100 |
| Mac Studio mit M5 Ultra und 512 GB | 6.600 Wörter | 9.100 | 9.100 |
| Station mit RTX 4090 24 GB | 7.400 Wörter | 10.300 | 10.200 |
| PC mit RTX 3060 12 GB | 11.300 Wörter | 16.800 | 16.600 |
| PC mit RTX 4070 12 GB | 11.300 Wörter | 16.800 | 16.600 |
| Mac mit M4 und 16 GB | 11.300 Wörter | 16.800 | 16.600 |
| Bürolaptop, 16 GB | 11.300 Wörter | 16.800 | 16.600 |
| Mac mini mit M6 und 16 GB | 11.300 Wörter | 16.800 | 16.600 |
| Mini-PC mit NPU und 32 GB | 11.500 Wörter | 16.900 | 17.300 |
| Mac mini mit M6 und 32 GB | 11.500 Wörter | 16.900 | 17.300 |
| Server 2× RTX 3090 (48 GB) | 11.500 Wörter | 16.900 | 17.300 |
| Mac mit M4 Max und 64 GB | 11.500 Wörter | 16.900 | 17.300 |
| Mac mini mit M5 Pro und 64 GB | 11.500 Wörter | 16.900 | 17.300 |
| Xiaomi AI Cube, 80 GB (Prototyp) | 11.500 Wörter | 16.900 | 17.300 |
| PC mit Ryzen AI Max+ 395 und 128 GB | 11.500 Wörter | 16.900 | 17.300 |
| Mac Studio mit M5 Max und 128 GB | 11.500 Wörter | 16.900 | 17.300 |
| PC mit Ryzen AI Max+ PRO 495 und 192 GB | 11.500 Wörter | 16.900 | 17.300 |
Gemessen von Local AI Scope, Dokumenttyp Vertrag; die reservierte Antwort sind 10 % der Eingabe, mindestens 300 Wörter — genau das, was das Werkzeug rechnet.
Schuld ist die Stufe. Das Programm reserviert den Kontext in Zweierpotenzen, also wird der Unterschied geschluckt, bis er eine Schwelle überschreitet — und dann springt er auf einmal. Ein bisschen wie beim Fluggepäck: alles gut, bis die Waage über die Grenze kippt. Die kleine Karte überschreitet sie am frühesten, weil ihr Spielraum am engsten ist.
Auf 8 GB macht Deutsch das Modell kleiner, sonst macht es das Warten länger
Der Aufschlag zeigt sich nicht überall gleich, und das hier ist die nützlichste Zeile dieser Seite.
Auf 12 und 16 GB fällt kein Modell weg, und Deutsch kostet schlicht Wartezeit. Dasselbe Modell, dieselbe Geschwindigkeit, nur eine Kontextstufe höher:
| Rechner | Modell | Schreibt mit | Englisch | Deutsch |
|---|---|---|---|---|
| Bürolaptop, 16 GB, ohne Grafikkarte | gemma4-12b |
~4,1 Tokens/s | ~7 min 48 s | ~12 min 21 s |
| Mac mit M4 und 16 GB | gemma4-12b |
~9,3 Tokens/s | ~87 s | ~2 min 18 s |
| PC mit RTX 3060 12 GB | gemma4-12b |
~33 Tokens/s | ~25 s | ~40 s |
| Station mit RTX 4090 24 GB | qwen3.6-35b-a3b |
~213 Tokens/s | ~2 s | ~3 s |
Wartezeit bis zum ersten Wort, Dokument mit 4.000 Wörtern. Geschätzt von Local AI Scope, nicht gemessen: die Formel verwendet die vom Hersteller angegebene Speicherbandbreite und Rechenleistung mit vorsichtigen Wirkungsgraden. Sie ist veröffentlicht, damit sie nachprüfbar ist, und sie entscheidet nie darüber, ob ein Modell passt.
Bei einer normalen Nachricht von rund 1.000 Wörtern auf Deutsch wartet die RTX 4060 etwa 6 Sekunden und schreibt mit rund 33 Tokens/s; der Laptop ohne Grafikkarte wartet etwa 21 Sekunden bei rund 17 Tokens/s.
PC mit RTX 4060 8 GBHardware-DatenblattReicht eine lokale KI für die tägliche Arbeit?
Für einen Teil der Arbeit ja, für den anderen klar nein — deshalb lohnt es sich, die Frage zu teilen.
Kurze Aufgaben von ein bis zwei Seiten — entwerfen, umformulieren, zusammenfassen, Fragen zu einem Dokument, offline arbeiten: das ist genau die Art von Aufgabe, für die ein Modell auf einem normalen Rechner gedacht ist, und Datenschutz und feste Kosten sind echte Gewinne.
Über eine ganze Akte hinweg argumentieren, Code über ein komplettes Projekt, oder alles, wobei Sie sich auf ein großes Modell verlassen haben: außer auf einem Mac Studio mit 512 GB ist die Datei auf Ihrer Platte je nach Rechner 3 bis 94 Mal kleiner als die größte, die wir katalogisieren, und keine Einstellung schließt diesen Abstand.

Was heißt DSGVO-konform hier wirklich?
Lokal ausführen heißt: keine Übermittlung an einen Dritten, also kein Auftragsverarbeitungsvertrag nach Art. 28, keine Prüfung der Drittlandübermittlung, keine Zusicherung zum Ausschluss vom Training, die man glauben muss. Der Vorgang entfällt, statt kleiner zu werden — und das ist der einzige Punkt in diesem Vergleich, bei dem lokal nicht «etwas weniger, dafür privat» ist, sondern schlicht besser. Das freut uns jedes Mal wieder.
Was es nicht heißt: dass damit alles erledigt ist. Das Programm, mit dem Sie das Modell ausführen, kann Telemetrie senden; eine Vektordatenbank für Ihre eigenen Dokumente ist eine zweite Kopie Ihrer Daten; und eine offene lokale API im Firmennetz ist ein Zugang wie jeder andere. Was jedes Programm sendet, steht in den Programm-Datenblättern.
Was wir hier nicht messen
Was der Größenunterschied an Antwortqualität kostet, haben wir nicht gemessen, und wir setzen keine Zahl dafür an.
Wir messen auch nicht die Qualität der Antwort auf Deutsch: dafür müsste man die Modelle ausführen und ihre Antworten bewerten, dafür fehlt uns eine GPU, und eine Formel «Benchmark» zu nennen ist genau der Fehler, für dessen Vermeidung diese Seite existiert. Was wir messen, sind die Kosten der Sprache in Tokens und das, was daraus an Reservierung folgt.
Wer behauptet, sein lokales Modell antworte «auf Deutsch so gut wie GPT», ohne zu veröffentlichen, wie er das gemessen hat, rät.
Wenn Sie etwas kaufen, kaufen Sie Speicher
Zwei Regeln halten in allen Szenarien, die wir durchgerechnet haben.
- Der Speicher entscheidet, was passt; die Bandbreite entscheidet, wie schnell es läuft. Eine RTX 4070 12 GB und eine RTX 3060 12 GB lassen exakt dieselben Modelle hineinpassen. Die 4070 führt sie schneller aus und fügt keines hinzu.
- Die Angabe ist die Dateigröße, nicht die Parameterzahl.
gemma4-12bwiegt 6,63 GiB undqwen3-coder-30b17,28 GiB: das zweite passt auf keine 12-GB-Karte, egal was der Name verspricht.

Die Rechner-Datenblätter enthalten für jede Maschine beide Listen, was passt und was nicht, nach derselben Zählung wie diese Seite. Für die Kaufperspektive: PC für KI-Anwendungen. Diese Reihenfolge wird berechnet, bevor wir schauen, was gerade lieferbar ist — so steht es in unseren Redaktionsrichtlinien: hier steigt kein Gerät im Rang, nur weil es leichter zu kaufen ist.
Drei Fragen, und das Werkzeug beantwortet sie
Der Modellfinder braucht drei Antworten und läuft vollständig in Ihrem Browser: was Sie eingeben, erreicht uns nicht.
- Welchen Rechner haben Sie? Speicher und Art, nicht Marke. Fangen Sie mit Ihrem an: RTX 4060 8 GB · RTX 3060 12 GB · Mac M4 16 GB · Laptop ohne Grafikkarte · RTX 4090 24 GB.
- Was geben Sie ihm, wie lang, und in welcher Sprache? Eine E-Mail mit 600 Wörtern und ein Vertrag mit 12.000 sind Probleme unterschiedlicher Maschinen, und die Sprache verschiebt die Antwort.
- Was steckt in diesen Daten? Nichts Heikles, firmenintern, personenbezogen, oder darf den Rechner nicht verlassen. Nur die letzte Antwort macht aus dem Urteil eine Anforderung statt einer Vorliebe.
Mac mit M4 und 16 GB Unified MemoryHardware-Datenblatt
Workstation mit RTX 4090 24 GBHardware-Datenblatt
Öffnet YouTube (ohne Cookies) erst, wenn Sie auf Play drücken. Mehr Videos im Datenblatt →
Ein Unterschied, den man kennen sollte: das Werkzeug zeigt zusätzlich, was bei stärkerer Kompression als Q4_K_M passen würde, und kennzeichnet das. Die Zählungen dieser Seite lassen es nie zu.