Welche lokale KI können Sie wirklich betreiben?
Sagen Sie, welchen Rechner Sie haben, womit Sie arbeiten und wie heikel diese Arbeit ist. Die Antwort kommt in Messwerten: was passt, wie viel Kontext Sie sich leisten können, wie lange Sie warten — und ob lokal überhaupt die richtige Wahl ist.
Drei Zahlen, die kein VRAM-Rechner zeigt
Jede ist aus der veröffentlichten Methode reproduzierbar, und jede ändert eine Entscheidung, die jemand gerade trifft.
Um so viel überschätzt die generische VRAM-Formel den Speicher eines Modells von 2026 bei 32k Kontext. Die meisten Rechner nutzen sie weiterhin und melden deshalb, etwas passe nicht, obwohl es passt.
Gemessen von Local AI ScopeSo viel kostet dasselbe Dokument auf Deutsch statt auf Englisch, in Tokens, mit der Qwen3-Familie. Tokens zahlt man im Kontext, im Speicher und in der Cloud-Rechnung.
Gemessen von Local AI ScopeVon 640 getesteten Fällen, in denen allein die Sprache den zu reservierenden Kontext ändert. In 14,4 % ändert sie sogar das empfohlene Modell.
Gemessen von Local AI ScopeFünf Einstiege, je nach Vorwissen
Jeder endet in einem Datenblatt mit Messwerten und Datum, nicht in einem Anmeldeformular.
Sie nennen Ihren Rechner, es antwortet mit Messwerten
Ihre GPU oder Ihr Mac, die Art der Arbeit, wie heikel die Daten sind und in welcher Sprache Sie schreiben. Es nennt, was passt, bei wie viel Kontext, wie lange das erste Wort braucht und ob lokal überhaupt sinnvoll ist. Keine E-Mail, kein Konto, nichts verlässt Ihren Browser.
10 Rechnerprofile · 18 Modelle · 4 SprachenModelleJedes Modell aus den veröffentlichten Dateien berechnet
Nicht Parameter mal Bits: die Datei, die der Autor veröffentlicht hat, plus der Schicht für Schicht berechnete Kontextspeicher.
1,03 → 433,83 GiBHardwareZehn Rechner, und was wirklich übrig bleibt
Wie viel Speicher bleibt, wenn das System seinen Teil genommen hat, und welche Modelle in den Rest passen — mit beiden Listen, den passenden und den nicht passenden.
7,20 → 61,00 GiB freiRuntimesFünf Programme, im Quelltext gelesen
Telemetrie ab Werk, wen sie sonst noch kontaktieren, auf welcher Adresse sie lauschen und ob das jemand außerhalb der Firma prüfen kann.
3 von 5 prüfbarLeitfädenDie langen Antworten, mit offener Rechnung
Warum die übliche Formel den Cache überzeichnet, was ein Token in Ihrer Sprache kostet und welche Karte ihr Geld wert ist.
Methode Schritt für SchrittWoher jede Zahl stammt
Die Größe jedes Modells ist die der tatsächlich von seinem Autor veröffentlichten Datei. Der Kontextspeicher wird aus dem Aufmerksamkeitsmuster berechnet, das in der offiziellen Konfiguration Schicht für Schicht angegeben ist, nicht aus der generischen Formel: bei gemma-4-12B mit 32k ergibt jene Formel 12,00 GiB, während der echte Speicher 2,31 GiB beträgt. Die Kosten jeder Sprache werden gemessen, indem der eigene Tokenizer jedes Modells über ein Parallelkorpus läuft — derselbe Inhalt in allen vier Sprachen.
Was noch nicht gemessen ist: ob ein Modell auf Französisch oder Deutsch besser schreibt. Das verlangt, sie auszuführen und zu bewerten, und solange diese Messung nicht existiert, behauptet dieses Werkzeug es nicht. Die Geschwindigkeiten sind Schätzungen aus Herstellerangaben; sie entscheiden nie darüber, ob etwas passt.
Was gefragt wird, bevor man einer Zahl hier glaubt
Warum sagt Ihr Rechner, ein Modell passe, wenn andere das Gegenteil sagen?
Weil der Kontext-Cache aus dem Attention-Muster berechnet wird, das jedes Modell Schicht für Schicht angibt, und nicht aus der Lehrbuchformel. gemma4-12b gibt 48 Schichten an, davon nur 8 mit voller Attention; die anderen 40 gleiten über 1024 Tokens und halten nie mehr. Bei 32k sind das 2,31 GiB echter Cache gegenüber den 12,00 GiB der generischen Formel.
Ändert die Sprache, in der ich arbeite, wirklich das passende Modell?
Ja, und das ist gemessen, nicht behauptet. Derselbe Vertrag mit 12 000 Wörtern kostet mit der Qwen3-Familie ×1,62 mehr Tokens auf Deutsch als auf Englisch. In 30,6 % der 640 getesteten Fälle ändert allein die Sprache den zu reservierenden Kontext; in 14,4 % ändert sie sogar das empfohlene Modell.
Wissen Sie, ob ein Modell auf Französisch oder auf Deutsch besser schreibt?
Nein, und diese Seite behauptet es nicht. Antwortqualität je Sprache zu messen hieße, die Modelle auszuführen und zu bewerten; das haben wir nicht getan. Gemessen wird hier, was eine Sprache an Tokens kostet — und Tokens sind das, was Sie in Kontext, Speicher und Cloud-Rechnung bezahlen. Alles zur Qualität wäre eine Meinung im Gewand einer Zahl.
Verlässt etwas, das ich im Werkzeug eingebe, meinen Browser?
Nein. Der Model Finder rechnet alles lokal mit einem Datensatz, den die Seite bereits geladen hat. Es gibt kein Konto, kein E-Mail-Feld und keine Anfrage, die Ihre Angaben mitnimmt. Die beiden Schriften liegen aus demselben Grund auf dem eigenen Server: Nichts auf dieser Seite fragt einen Dritten um etwas.
Finden Sie heraus, was Ihr Rechner schafft
Zehn Rechnerprofile, achtzehn Modelle, vier Sprachen. Die Antwort entsteht im Browser und nennt die Herkunft jeder Zahl.
Setup für meinen Rechner finden