Startseite›Modelle›granite-4.2-8b

Modell-Datenblatt

granite-4.2-8b

Architektur dicht40 SchichtenLizenz apache-2.0Maximaler Kontext 128kVokabular 100.352

Bei Q4_K_M ist das eine Datei von 4,98 GiB, und sie passt auf 18 der 18 getesteten Rechner. Teuer ist nicht die Datei, sondern der Kontext — und derselbe Inhalt kostet auf Deutsch das ×1,61-fache von Englisch.

Auf einen Blick
Größe bei Q4_K_M4,98 GiB
Kontextspeicher bei 8k1,25 GiB
Passt auf18 / 18
Kosten auf Deutsch×1,61
Kleinster Rechner, der es nimmtPC mit RTX 4060 8 GB
4,98 GiB

Modellgröße bei Q4_K_M

Von Local AI Scope gemessen

1,25 GiB

Kontextspeicher bei 8k Tokens

Von Local AI Scope gemessen

×1,61

Was Deutsch gegenüber Englisch kostet

Von Local AI Scope gemessen

Größen

Größen der veröffentlichten Dateien

Das sind die Größen der tatsächlich vom Autor veröffentlichten Dateien, addiert, wenn das Modell in Teilen ausgeliefert wird. Keine Schätzung aus der Parameterzahl.

Größe der veröffentlichten Datei je Kompression
Kompression Modellgröße
Q8_0 8,70 GiB
Q6_K 6,72 GiB
Q5_K_M 5,82 GiB
Q5_K_S 5,68 GiB
Q4_K_M 4,98 GiB
Q4_K_S 4,74 GiB
Q3_K_M 4,05 GiB
Kontext

Kontextspeicher

Berechnet aus dem Aufmerksamkeitsmuster, das dieses Modell Schicht für Schicht angibt, nicht aus der generischen Formel. Deshalb liegt der Wert oft deutlich unter dem anderer Rechner. Die config.json dieses Modells nennt nicht die Größe jedes Aufmerksamkeitskopfes, und aus dieser Zahl besteht der Kontextspeicher. Wir leiten sie aus zwei Angaben ab, die sehr wohl dort stehen: 4.096 verborgene Einheiten geteilt durch 32 Aufmerksamkeitsköpfe, was die Größe eines Kopfes gerade bedeutet und was die Referenzbibliothek voreinstellt: 128. Alle Zahlen dieses Abschnitts ruhen auf dieser Ableitung, deshalb wird sie hier gekennzeichnet und nicht stillschweigend übergangen.

  • 8k Tokens → 1,25 GiB
  • 32k Tokens → 5,00 GiB
  • 128k Tokens → 20,00 GiB
Sprachen

Was es in jeder Sprache kostet

Gemessen, indem der Tokenizer dieses Modells über denselben Inhalt in vier Sprachen läuft. Tokens sind das, was man im Kontext, im Speicher und auf der Cloud-Rechnung zahlt.

Tokenkosten nach Textsorte und Sprache, mit Englisch als Referenz
Textsorte EN ES FR DE
Code — ×1,22 ×1,42 ×1,60
Verträge — ×1,39 ×1,47 ×1,76
Geschäftliche E-Mails — ×1,27 ×1,41 ×1,48
Support-Tickets — ×1,39 ×1,63 ×1,55

Englisch ist die Referenz: Jede Zahl gibt an, um wie viel mehr Tokens derselbe Inhalt in dieser Sprache kostet. Durchschnitt über das gesamte Korpus: DE ×1,61.

Rechner

Wo es passt

Passt heißt: Modell, Kontextspeicher und Arbeitsreserve passen beim angegebenen Kontext gemeinsam hinein und lassen dem System seinen Anteil. 18 von den 18 getesteten Rechnern (Q4_K_M, 8k Tokens).

Die 18 getesteten Rechner, mit dem Speicher, den jeder frei lässt, und dem größten Kontext, den dieses Modell dort hält
Rechner Passt Freier Speicher Größter Kontext, der passt
PC mit RTX 4060 8 GB ja 7,20 GiB 8k
PC mit RTX 3060 12 GB ja 11,20 GiB 32k
PC mit RTX 4070 12 GB ja 11,20 GiB 32k
Mac mit M4 und 16 GB Unified Memory ja 13,00 GiB 32k
Büro-Notebook, nur CPU, 16 GB ja 13,00 GiB 32k
Mac mini mit M6 und 16 GB Unified Memory ja 13,00 GiB 32k
Mac mit M4 Pro und 24 GB ja 21,00 GiB 64k
Workstation mit RTX 4090 24 GB ja 23,20 GiB 64k
Mini-PC mit NPU und 32 GB LPDDR5X ja 29,00 GiB 128k
Mac mini mit M6 und 32 GB Unified Memory ja 29,00 GiB 128k
Server mit 2× RTX 3090 (48 GB) ja 47,20 GiB 128k
Mac mit M4 Max und 64 GB ja 61,00 GiB 128k
Mac mini mit M5 Pro und 64 GB Unified Memory ja 61,00 GiB 128k
Xiaomi AI Cube, 80 GB — Technikprototyp ja 77,00 GiB 128k
PC mit Ryzen AI Max+ 395 und 128 GB Unified Memory ja 96,00 GiB 128k
Mac Studio mit M5 Max und 128 GB Unified Memory ja 125,00 GiB 128k
PC mit Ryzen AI Max+ PRO 495 und 192 GB Unified Memory ja 160,00 GiB 128k
Mac Studio mit M5 Ultra und 512 GB Unified Memory ja 509,00 GiB 128k