Startseite›Modelle›qwen3.8-flash-next
qwen3.8-flash-next
Architektur Expertenmischung48 SchichtenLizenz qwen-community-1.0Maximaler Kontext 256kVokabular 248.320
Bei IQ4_XS ist das eine Datei von 87,25 GiB, und sie passt auf 4 der 18 getesteten Rechner. Hier füllt die Datei den Speicher: Selbst beim maximalen Kontext von 256k Tokens kommen nur 6,00 GiB hinzu — und derselbe Inhalt kostet auf Deutsch das ×1,31-fache von Englisch.
Modellgröße bei IQ4_XS
Von Local AI Scope gemessen
Kontextspeicher bei 8k Tokens
Von Local AI Scope gemessen
Was Deutsch gegenüber Englisch kostet
Von Local AI Scope gemessen
Größen der veröffentlichten Dateien
Das sind die Größen der tatsächlich vom Autor veröffentlichten Dateien, addiert, wenn das Modell in Teilen ausgeliefert wird. Keine Schätzung aus der Parameterzahl.
| Kompression | Modellgröße |
|---|---|
Q8_0 |
175,30 GiB |
IQ4_XS |
87,25 GiB |
Dieses Modell liest auch Bilder. Dafür braucht es eine zweite Datei, den Vision-Projektor (mmproj-F16.gguf, 0,84 GiB), die neben dem Modell veröffentlicht wird und in den Zahlen dieser Seite nicht enthalten ist: Sie zählen nur Text. Wenn Sie ihm Bilder schicken wollen, rechnen Sie diese Datei zur Modellgröße hinzu.
Kontextspeicher
Berechnet aus dem Aufmerksamkeitsmuster, das dieses Modell Schicht für Schicht angibt, nicht aus der generischen Formel. Deshalb liegt der Wert oft deutlich unter dem anderer Rechner. Neben diesem Speicher hält das Modell einen zweiten, kleineren Cache für den Indexer seiner dünnbesetzten Aufmerksamkeit: etwa 3 KiB pro Token, 0,02 GiB bei 8k und 0,75 GiB beim maximalen Kontext. Er ist aus dem Code und dem Dateikopf abgeleitet, nicht vom Autor angegeben, und in den Zahlen dieser Seite nicht enthalten. Mitgezählt ändert er kein einziges Urteil in der Gerätetabelle.
- 8k Tokens → 0,19 GiB
- 32k Tokens → 0,75 GiB
- 128k Tokens → 3,00 GiB
Was es in jeder Sprache kostet
Gemessen, indem der Tokenizer dieses Modells über denselben Inhalt in vier Sprachen läuft. Tokens sind das, was man im Kontext, im Speicher und auf der Cloud-Rechnung zahlt.
| Textsorte | EN | ES | FR | DE |
|---|---|---|---|---|
| Code | — | ×1,20 | ×1,30 | ×1,46 |
| Verträge | — | ×1,16 | ×1,23 | ×1,31 |
| Geschäftliche E-Mails | — | ×1,12 | ×1,22 | ×1,17 |
| Support-Tickets | — | ×1,24 | ×1,40 | ×1,25 |
Englisch ist die Referenz: Jede Zahl gibt an, um wie viel mehr Tokens derselbe Inhalt in dieser Sprache kostet. Durchschnitt über das gesamte Korpus: DE ×1,31.
Wo es passt
Passt heißt: Modell, Kontextspeicher und Arbeitsreserve passen beim angegebenen Kontext gemeinsam hinein und lassen dem System seinen Anteil. 4 von den 18 getesteten Rechnern (IQ4_XS, 8k Tokens).
Ein Teil dieses Modells verhält sich je nach Programm unterschiedlich. 26,82 GiB der IQ4_XS-Datei sind eine N-Gramm-Tabelle (per_layer_token_embd), aus der immer nur wenige Zeilen auf einmal gelesen werden. llama.cpp v0.5.0 und neuer lassen sie standardmäßig auf der Festplatte und lesen diese Zeilen bei Bedarf, sodass im Speicher nur noch 60,43 GiB Platz finden müssen. Auf dieser Grundlage würde es auch auf Xiaomi AI Cube, 80 GB — Technikprototyp passen, bis 256k Tokens Kontext. Am knappsten verfehlt: Mac mit M4 Max und 64 GB · Mac mini mit M5 Pro und 64 GB Unified Memory, um 0,20 GiB. Die Tabelle oben zählt die ganze Datei, denn das gilt für jedes Programm; die Ersparnis ist nur für llama.cpp v0.5.0 geprüft, im Code und im Dateikopf. Derselbe Code kennzeichnet die Unterstützung dieser Architektur als vorläufig, bis zu einer vollständigen Neuimplementierung (gelesen am 29. September 2026).
