StartseiteRechnerPC mit RTX 4070 12 GB

Rechner-Datenblatt

PC mit RTX 4070 12 GB

NVIDIA-Grafikkarte12 GiB504 GB/s29,1 TFLOPS

Dieser Rechner lässt dem Modell 11,20 GiB, nachdem das System seinen Anteil genommen hat, und er nimmt 6 der 18 Modelle auf, die wir bei der Referenzkompression messen. Über das Tempo der Antwort entscheidet nicht der Chip, sondern die 504 GB/s Speicherbandbreite.

Auf einen Blick
Bleibt für das Modell11,20 GiB
Speicherbandbreite504 GB/s
Modelle, die passen6 / 18
Größtes Modell, das passtgemma4-12b
11,20 GiB

Bleibt für das Modell

Eigene Schätzung

504 GB/s

Speicherbandbreite

Eigene Schätzung

6 / 18

Modelle, die passen

Von Local AI Scope gemessen

Speicher

Der Speicher, den Sie wirklich nutzen können

Deshalb ist die Zahl auf der Verpackung nicht die Zahl, die Sie bekommen. Schreibtisch, Compositor und Grafikkontext geben ihren Anteil nie zurück, und ein Modell, das ihnen keinen Platz lässt, startet nicht — es stürzt ab.

Wie aus dem Speicher auf der Verpackung nutzbarer Speicher wird
Speicher GiB
Speicher des Rechners 12
Für das System reserviert −0,80
Bleibt für das Modell 11,20
Tempo

Speicherbandbreite

Es sind zwei verschiedene Grenzen, und sie werden ständig verwechselt. Während das Modell die Antwort schreibt, bestimmt die Bandbreite: Für jeden einzelnen Token müssen die Gewichte erneut gelesen werden, Tokens pro Sekunde sind also ungefähr Bandbreite geteilt durch Modellgröße. Während das Modell Ihr Dokument liest, bestimmt die Rechenleistung: Die Eingabe wird auf einmal verarbeitet. Darum kann ein Notebook ohne GPU Minuten bis zum ersten Wort brauchen und danach in erträglichem Tempo schreiben.

504 GB/sAbgeleitet, nicht vom Hersteller veröffentlicht · der Hersteller veröffentlicht die Busbreite, aber weder die Speichergeschwindigkeit noch die Bandbreite. Diese Zahl ist die übliche rechnerische Ableitung (21 Gbps x 192 bit / 8 = 504 GB/s), an der Quelle konnten wir sie nicht bestätigen (Quelle).

Rechenleistung: 29,1 TFLOPS (FP32-Shader-TFLOPS) — Herstellerangabe, unter anderem Namen · der Hersteller veröffentlicht diese Zahl als FP32-Shader-TFLOPS, nicht als FP16; gegen die Herstellerseite geprüft am 2026-08-25 (Quelle). Die Zahlen dieser Zeile stammen je nach Rechner nicht aus derselben Messgröße, weil jeder Hersteller eine andere veröffentlicht. Vergleichen Sie sie zwischen Rechnern nur mit diesem Wissen.

Passung

Welche Modelle hier hineinpassen und welche nicht

Passen heißt, dass drei Dinge gleichzeitig in den übrigen Speicher passen: die Modelldatei, ihr Kontextspeicher und die Arbeitsreserve der Laufzeitumgebung. Der Kontextspeicher wird aus dem von jedem Modell angegebenen Aufmerksamkeitsmuster Schicht für Schicht berechnet, nicht aus der generischen Formel — deshalb passen hier Modelle, die andere Rechner für unmöglich erklären.

Jedes gemessene Modell gegen diesen Rechner: Größe, ob es bei jedem Kontext passt, und der größte Kontext, den es hält
Modell Gezeigte Kompression Modellgröße 8k 32k 128k Größter Kontext, der passt
qwen3-1.7b Q4_K_M 1,03 GiB ja ja 32k
qwen3-4b-2507 Q4_K_M 2,33 GiB ja ja nein 32k
gemma4-e2b Q4_K_M 2,89 GiB ja ja ja 128k
gemma4-e4b Q4_K_M 4,63 GiB ja ja ja 128k
qwen3-8b Q4_K_M 4,68 GiB ja ja 32k
gemma4-12b Q4_K_M 6,63 GiB ja ja nein 32k
gpt-oss-20b Q4_K_M 10,83 GiB nein nein nein
mistral-small-24b Q4_K_M 13,35 GiB nein nein nein
qwen3.8-27b Q4_K_M 15,33 GiB nein nein nein
qwen3.6-27b Q4_K_M 15,66 GiB nein nein nein
gemma4-26b-a4b Q4_K_M 15,78 GiB nein nein nein
gemma4-31b Q4_K_M 17,07 GiB nein nein nein
qwen3-coder-30b Q4_K_M 17,28 GiB nein nein nein
qwen3.6-35b-a3b Q4_K_M 20,61 GiB nein nein nein
gpt-oss-120b Q4_K_M 58,46 GiB nein nein nein
llama4-scout-17b Q4_K_M 60,87 GiB nein nein nein
deepseek-v4-flash IQ4_XS 127,28 GiB nein nein nein
glm-5.2 Q4_K_M 433,83 GiB nein nein nein

Die Größen sind die der tatsächlich veröffentlichten Dateien in der Referenzkompression, eine Stufe je Zeile: Q4_K_M, wo der Autor sie veröffentlicht, sonst die nächstgelegene. Jede Zeile nennt, welche sie zeigt. Q4_K_M ist unsere Qualitätsuntergrenze: darunter ist der Verlust in den Antworten hörbar. Ein Modell, das hier nur mit stärkerer Kompression passen würde, gilt bewusst als nicht passend. Ein Gedankenstrich in einer Kontextspalte heißt, dass das Modell diesen Kontext gar nicht anbietet, es gibt also nichts einzupassen.

Modelle, die passen — 6 von den 18 gemessenen Modellen

Modelle, die nicht passen — 12 von den 18 gemessenen Modellen