Ein Modell passt, wenn seine Gewichtsdatei, sein Kontextspeicher und der Puffer des ausführenden Programms zusammen in das passen, was übrig bleibt, nachdem das System seinen Anteil genommen hat. Auf einer 12-GB-Karte passen bei einem Vertrag von 12.000 Wörtern auf Englisch 6 der 18 gemessenen Modelle, auf Deutsch 3.
Deutsch ist unter den vier gemessenen Sprachen der Ausreißer, und zwar durchgehend.
Wie viel Speicher bleibt wirklich übrig
Eine 16-GB-Maschine bietet keine 16 GB. Wir ziehen 0,8 GiB bei dedizierten Grafikkarten ab und 3 GiB bei Unified Memory oder Systemspeicher.
- PC mit RTX 4060 8 GB: 7,20 GiB für das Modell, 5 von 18 Modellen bei 8k Kontext
- PC mit RTX 3060 12 GB: 11,20 GiB, 6 von 18
- PC mit RTX 4070 12 GB: 11,20 GiB, 6 von 18
- Mac mit M4 und 16 GB Unified Memory: 13,00 GiB, 7 von 18
- Büro-Notebook, nur CPU, 16 GB: 13,00 GiB, 7 von 18
- Mac mit M4 Pro und 24 GB: 21,00 GiB, 13 von 18
- Workstation mit RTX 4090 24 GB: 23,20 GiB, 14 von 18
- Mini-PC mit NPU und 32 GB LPDDR5X: 29,00 GiB, 14 von 18
- Mac mit M4 Max und 64 GB: 61,00 GiB, 15 von 18
Berechnet von Local AI Scope. „Passt” = Gewichte + Kontextspeicher + Programmpuffer ≤ verfügbarer Speicher, mit der Datei in Q4_K_M oder der nächstliegenden vom Autor veröffentlichten Kompression. Q4_K_M als Untergrenze ist ein erklärtes redaktionelles Kriterium, keine Messung: darunter sinkt die Qualität, um wie viel, haben wir nicht gemessen.
Keine Maschine erreicht 18. Drei Modelle passen auf keine der zehn: glm-5.2 (433,83 GiB), deepseek-v4-flash (127,28 GiB) und llama4-scout-17b (60,87 GiB). Die reale Obergrenze liegt bei 15 von 18.
Der Sprung von 8 auf 12 GB fügt genau ein Modell hinzu, gemma4-12b. Was er wirklich kauft, ist Puffer. Der Sprung, der etwas ändert, liegt bei 24 GB: dort geht es von 6 auf 14.
Warum Deutsch die Rechnung verschiebt
Kontext wird in Tokens reserviert, und derselbe Text ist auf Deutsch nicht dieselbe Anzahl Tokens wie auf Englisch: je nach Modell das 1,29- bis 1,62-Fache, gemessen mit dem echten Tokenizer jedes Modells auf einem eigenen parallelen Korpus (sha256[:16] 2f6c96b6ea0b161f).
| Maschine | Englisch | Spanisch | Französisch | Deutsch |
|---|---|---|---|---|
| PC mit RTX 4060 8 GB | 4 | 3 | 3 | 2 |
| PC mit RTX 3060 12 GB | 6 | 6 | 6 | 3 |
| PC mit RTX 4070 12 GB | 6 | 6 | 6 | 3 |
| Mac mit M4 und 16 GB | 7 | 7 | 7 | 4 |
| Büro-Notebook, 16 GB | 7 | 7 | 7 | 4 |
| Mac mit M4 Pro und 24 GB | 12 | 11 | 11 | 9 |
| Workstation RTX 4090 24 GB | 14 | 13 | 13 | 10 |
| Server 2× RTX 3090 (48 GB) | 14 | 14 | 14 | 12 |
| Mac mit M4 Max und 64 GB | 15 | 15 | 15 | 13 |
Gemessen von Local AI Scope. Vertragstext mit 12.000 Wörtern, 600 Wörter Antwort; gleiches Passt-Kriterium wie oben.
Deutsch verliert Modelle in allen neun Zeilen, Spanisch und Französisch nur in dreien. Und es beginnt früher: in 100-Wörter-Schritten gemessen, mit einem Vertragstext, nimmt Deutsch ab 2.600 Wörtern Modelle weg, Spanisch erst ab 4.100 und Französisch ab 4.200.
Die Wahl des Tokenizers kostet mehr als die Wahl der Karte
Die Strafe folgt der Größe des Tokenizer-Vokabulars, nicht dem Hersteller. Zwei Modelle desselben Hauses können an entgegengesetzten Enden dieser Tabelle stehen.
| Modell | Vokabular | Deutsch | Größe (Referenz) |
|---|---|---|---|
gpt-oss-20b |
201.088 | 1,29 | 10,83 GiB |
llama4-scout-17b |
202.048 | 1,30 | 60,87 GiB |
qwen3.8-27b |
248.320 | 1,31 | 15,33 GiB |
gemma4-12b |
262.144 | 1,33 | 6,63 GiB |
mistral-small-24b |
131.072 | 1,40 | 13,35 GiB |
glm-5.2 |
154.880 | 1,49 | 433,83 GiB |
qwen3-8b |
151.936 | 1,62 | 4,68 GiB |
qwen3-coder-30b |
151.936 | 1,62 | 17,28 GiB |
Gemessen von Local AI Scope, dasselbe Korpus. Größe in Q4_K_M bzw. der nächstliegenden veröffentlichten Kompression.
Dieselbe deutsche Arbeit kostet auf qwen3-8b 26 % mehr Tokens als auf gpt-oss-20b, bevor über Qualität gesprochen wurde. Bei Quelltext mit deutschen Kommentaren teilen sich vier Modelle den letzten Platz mit je 353 Tokens, weil sie denselben Tokenizer verwenden: qwen3-1.7b, qwen3-4b-2507, qwen3-8b und qwen3-coder-30b. Von diesen vieren ist qwen3-coder-30b das einzige, das ausdrücklich fürs Programmieren gebaut wurde, und mit 17,28 GiB auch das mit Abstand größte. Der ausführliche Fall steht auf Englisch.
Worauf vor dem Kauf zu achten ist
- Die Speichermenge, nicht die Kartennummer. Eine RTX 4070 mit 12 GB und eine RTX 3060 mit 12 GB lassen exakt dieselben sechs Modelle passen. Die 4070 führt sie schneller aus, sie lässt keines zusätzlich passen.
- Die tatsächliche Dateigröße, nicht die Parameterzahl.
gemma4-12bbelegt 6,63 GiB,qwen3-coder-30bbelegt 17,28 GiB. Das zweite passt in keine 12-GB-Maschine, egal was „30B” nahelegt. - Bei deutschen Dokumenten eine Stufe höher rechnen, und zwar früher als erwartet. Schon ab 2.600 Wörtern Vertragstext fällt auf dem PC mit RTX 4060 das erste Modell weg; bei Quelltext mit deutschen Kommentaren passiert es bereits ab 1.900.
- Unified Memory ist kein Grafikspeicher. Ein Mac mit 16 GB lässt 13 GiB übrig und damit sieben Modelle passen, zwei mehr als eine 4060 mit 8 GB, deutlich langsamer.
- Die Bandbreite entscheidet über das Tempo, nicht über das Passen. Das Notebook ohne Grafikkarte lässt dieselben sieben Modelle passen wie der Mac M4 mit 16 GB, bei 83 GB/s statt 120 GB/s.
Was hier nicht gemessen wird
Gemessen werden die Kosten der Sprache in Tokens und was daraus an Reservierung folgt. Nicht gemessen wird die Qualität der Antworten auf Deutsch: dafür müssten die Modelle ausgeführt und ihre Ausgaben bewertet werden, wofür ein GPU nötig ist, über das wir nicht verfügen. Eine Formel „Benchmark” zu nennen ist genau der Fehler, den diese Seite vermeiden soll.
Die Geschwindigkeiten neben jedem Ergebnis sind geschätzt, aus der vom Hersteller angegebenen Bandbreite. Sie entscheiden nie darüber, ob etwas passt.
Mit der eigenen Maschine nachrechnen
Der Modellfinder rechnet das für Ihre Maschine, Ihr Dokument und Ihre Sprache über alle 18 Modelle, vollständig im Browser: was Sie beschreiben, verlässt ihn nicht. Wer von der Hardware aus startet, findet in den Maschinenprofilen beide Listen. Das ausführende Programm zählt ebenfalls: siehe die Programm-Profile.