Modellfinder

Ein Modell, das auf Englisch passt, passt auf Deutsch vielleicht nicht.

VRAM-Rechner beantworten «passt es?» mit einer Formel, die zwei Dinge übergeht: wie Modelle von 2026 den Speicher tatsächlich verwalten und wie viele Tokens es kostet, dasselbe in jeder Sprache zu sagen. Hier ist beides gemessen.

Herkunft

Woher jede Zahl stammt

Die Größe jedes Modells ist die der tatsächlich von seinem Autor veröffentlichten Datei. Der Kontextspeicher wird aus dem Aufmerksamkeitsmuster berechnet, das in der offiziellen Konfiguration Schicht für Schicht angegeben ist, nicht aus der generischen Formel: bei gemma-4-12B mit 32k ergibt jene Formel 12,00 GiB, während der echte Speicher 2,31 GiB beträgt. Die Kosten jeder Sprache werden gemessen, indem der eigene Tokenizer jedes Modells über ein Parallelkorpus läuft — derselbe Inhalt in allen vier Sprachen.

Was noch nicht gemessen ist: ob ein Modell auf Französisch oder Deutsch besser schreibt. Das verlangt, sie auszuführen und zu bewerten, und solange diese Messung nicht existiert, behauptet dieses Werkzeug es nicht. Die Geschwindigkeiten sind Schätzungen aus Herstellerangaben; sie entscheiden nie darüber, ob etwas passt.