Startseite›Rechner›PC mit RTX 4060 8 GB
PC mit RTX 4060 8 GB
NVIDIA-Grafikkarte8 GiB272 GB/s15,0 TFLOPS
Dieser Rechner lässt dem Modell 7,20 GiB, nachdem das System seinen Anteil genommen hat, und er nimmt 5 der 18 Modelle auf, die wir bei der Referenzkompression messen. Über das Tempo der Antwort entscheidet nicht der Chip, sondern die 272 GB/s Speicherbandbreite.
Bleibt für das Modell
Eigene Schätzung
Speicherbandbreite
Eigene Schätzung
Modelle, die passen
Von Local AI Scope gemessen
Der Speicher, den Sie wirklich nutzen können
Deshalb ist die Zahl auf der Verpackung nicht die Zahl, die Sie bekommen. Schreibtisch, Compositor und Grafikkontext geben ihren Anteil nie zurück, und ein Modell, das ihnen keinen Platz lässt, startet nicht — es stürzt ab.
| Speicher | GiB |
|---|---|
| Speicher des Rechners | 8 |
| Für das System reserviert | −0,80 |
| Bleibt für das Modell | 7,20 |
Speicherbandbreite
Es sind zwei verschiedene Grenzen, und sie werden ständig verwechselt. Während das Modell die Antwort schreibt, bestimmt die Bandbreite: Für jeden einzelnen Token müssen die Gewichte erneut gelesen werden, Tokens pro Sekunde sind also ungefähr Bandbreite geteilt durch Modellgröße. Während das Modell Ihr Dokument liest, bestimmt die Rechenleistung: Die Eingabe wird auf einmal verarbeitet. Darum kann ein Notebook ohne GPU Minuten bis zum ersten Wort brauchen und danach in erträglichem Tempo schreiben.
272 GB/s — Abgeleitet, nicht vom Hersteller veröffentlicht · der Hersteller veröffentlicht die Busbreite, aber weder die Speichergeschwindigkeit noch die Bandbreite. Diese Zahl ist die übliche rechnerische Ableitung (17 Gbps x 128 bit / 8 = 272 GB/s), an der Quelle konnten wir sie nicht bestätigen (Quelle).
Rechenleistung: 15,0 TFLOPS (FP32-Shader-TFLOPS) — Herstellerangabe, unter anderem Namen · der Hersteller veröffentlicht diese Zahl als FP32-Shader-TFLOPS, nicht als FP16; gegen die Herstellerseite geprüft am 2026-08-25 (Quelle). Die Zahlen dieser Zeile stammen je nach Rechner nicht aus derselben Messgröße, weil jeder Hersteller eine andere veröffentlicht. Vergleichen Sie sie zwischen Rechnern nur mit diesem Wissen.
Welche Modelle hier hineinpassen und welche nicht
Passen heißt, dass drei Dinge gleichzeitig in den übrigen Speicher passen: die Modelldatei, ihr Kontextspeicher und die Arbeitsreserve der Laufzeitumgebung. Der Kontextspeicher wird aus dem von jedem Modell angegebenen Aufmerksamkeitsmuster Schicht für Schicht berechnet, nicht aus der generischen Formel — deshalb passen hier Modelle, die andere Rechner für unmöglich erklären.
| Modell | Gezeigte Kompression | Modellgröße | 8k | 32k | 128k | Größter Kontext, der passt |
|---|---|---|---|---|---|---|
| qwen3-1.7b | Q4_K_M |
1,03 GiB | ja | ja | — | 32k |
| qwen3-4b-2507 | Q4_K_M |
2,33 GiB | ja | nein | nein | 16k |
| gemma4-e2b | Q4_K_M |
2,89 GiB | ja | ja | ja | 128k |
| gemma4-e4b | Q4_K_M |
4,63 GiB | ja | ja | nein | 32k |
| qwen3-8b | Q4_K_M |
4,68 GiB | ja | nein | — | 8k |
| gemma4-12b | Q4_K_M |
6,63 GiB | nein | nein | nein | — |
| gpt-oss-20b | Q4_K_M |
10,83 GiB | nein | nein | nein | — |
| mistral-small-24b | Q4_K_M |
13,35 GiB | nein | nein | nein | — |
| qwen3.8-27b | Q4_K_M |
15,33 GiB | nein | nein | nein | — |
| qwen3.6-27b | Q4_K_M |
15,66 GiB | nein | nein | nein | — |
| gemma4-26b-a4b | Q4_K_M |
15,78 GiB | nein | nein | nein | — |
| gemma4-31b | Q4_K_M |
17,07 GiB | nein | nein | nein | — |
| qwen3-coder-30b | Q4_K_M |
17,28 GiB | nein | nein | nein | — |
| qwen3.6-35b-a3b | Q4_K_M |
20,61 GiB | nein | nein | nein | — |
| gpt-oss-120b | Q4_K_M |
58,46 GiB | nein | nein | nein | — |
| llama4-scout-17b | Q4_K_M |
60,87 GiB | nein | nein | nein | — |
| deepseek-v4-flash | IQ4_XS |
127,28 GiB | nein | nein | nein | — |
| glm-5.2 | Q4_K_M |
433,83 GiB | nein | nein | nein | — |
Die Größen sind die der tatsächlich veröffentlichten Dateien in der Referenzkompression, eine Stufe je Zeile: Q4_K_M, wo der Autor sie veröffentlicht, sonst die nächstgelegene. Jede Zeile nennt, welche sie zeigt. Q4_K_M ist unsere Qualitätsuntergrenze: darunter ist der Verlust in den Antworten hörbar. Ein Modell, das hier nur mit stärkerer Kompression passen würde, gilt bewusst als nicht passend. Ein Gedankenstrich in einer Kontextspalte heißt, dass das Modell diesen Kontext gar nicht anbietet, es gibt also nichts einzupassen.
Modelle, die passen — 5 von den 18 gemessenen Modellen
- qwen3-1.7b
Q4_K_M— Kontext 32k Tokens - qwen3-4b-2507
Q4_K_M— Kontext 16k Tokens - gemma4-e2b
Q4_K_M— Kontext 128k Tokens - gemma4-e4b
Q4_K_M— Kontext 32k Tokens - qwen3-8b
Q4_K_M— Kontext 8k Tokens
Modelle, die nicht passen — 13 von den 18 gemessenen Modellen
- gemma4-12b
Q4_K_M— es fehlen 0,67 GiB - gpt-oss-20b
Q4_K_M— es fehlen 4,40 GiB - mistral-small-24b
Q4_K_M— es fehlen 7,45 GiB - qwen3.8-27b
Q4_K_M— es fehlen 9,06 GiB - qwen3.6-27b
Q4_K_M— es fehlen 9,39 GiB - gemma4-26b-a4b
Q4_K_M— es fehlen 9,61 GiB - gemma4-31b
Q4_K_M— es fehlen 11,95 GiB - qwen3-coder-30b
Q4_K_M— es fehlen 11,13 GiB - qwen3.6-35b-a3b
Q4_K_M— es fehlen 14,17 GiB - gpt-oss-120b
Q4_K_M— es fehlen 52,08 GiB - llama4-scout-17b
Q4_K_M— es fehlen 55,10 GiB - deepseek-v4-flash
IQ4_XS— es fehlen 121,09 GiB - glm-5.2
Q4_K_M— es fehlen 441,93 GiB