Startseite›Modelle›qwen3.8-flash-next

Modell-Datenblatt

qwen3.8-flash-next

Architektur Expertenmischung48 SchichtenLizenz qwen-community-1.0Maximaler Kontext 256kVokabular 248.320

Bei IQ4_XS ist das eine Datei von 87,25 GiB, und sie passt auf 4 der 18 getesteten Rechner. Hier füllt die Datei den Speicher: Selbst beim maximalen Kontext von 256k Tokens kommen nur 6,00 GiB hinzu — und derselbe Inhalt kostet auf Deutsch das ×1,31-fache von Englisch.

Auf einen Blick
Größe bei IQ4_XS87,25 GiB
Kontextspeicher bei 8k0,19 GiB
Passt auf4 / 18
Kosten auf Deutsch×1,31
Kleinster Rechner, der es nimmtPC mit Ryzen AI Max+ 395 und 128 GB Unified Memory
87,25 GiB

Modellgröße bei IQ4_XS

Von Local AI Scope gemessen

0,19 GiB

Kontextspeicher bei 8k Tokens

Von Local AI Scope gemessen

×1,31

Was Deutsch gegenüber Englisch kostet

Von Local AI Scope gemessen

Größen

Größen der veröffentlichten Dateien

Das sind die Größen der tatsächlich vom Autor veröffentlichten Dateien, addiert, wenn das Modell in Teilen ausgeliefert wird. Keine Schätzung aus der Parameterzahl.

Größe der veröffentlichten Datei je Kompression
Kompression Modellgröße
Q8_0 175,30 GiB
IQ4_XS 87,25 GiB

Dieses Modell liest auch Bilder. Dafür braucht es eine zweite Datei, den Vision-Projektor (mmproj-F16.gguf, 0,84 GiB), die neben dem Modell veröffentlicht wird und in den Zahlen dieser Seite nicht enthalten ist: Sie zählen nur Text. Wenn Sie ihm Bilder schicken wollen, rechnen Sie diese Datei zur Modellgröße hinzu.

Kontext

Kontextspeicher

Berechnet aus dem Aufmerksamkeitsmuster, das dieses Modell Schicht für Schicht angibt, nicht aus der generischen Formel. Deshalb liegt der Wert oft deutlich unter dem anderer Rechner. Neben diesem Speicher hält das Modell einen zweiten, kleineren Cache für den Indexer seiner dünnbesetzten Aufmerksamkeit: etwa 3 KiB pro Token, 0,02 GiB bei 8k und 0,75 GiB beim maximalen Kontext. Er ist aus dem Code und dem Dateikopf abgeleitet, nicht vom Autor angegeben, und in den Zahlen dieser Seite nicht enthalten. Mitgezählt ändert er kein einziges Urteil in der Gerätetabelle.

  • 8k Tokens → 0,19 GiB
  • 32k Tokens → 0,75 GiB
  • 128k Tokens → 3,00 GiB
Sprachen

Was es in jeder Sprache kostet

Gemessen, indem der Tokenizer dieses Modells über denselben Inhalt in vier Sprachen läuft. Tokens sind das, was man im Kontext, im Speicher und auf der Cloud-Rechnung zahlt.

Tokenkosten nach Textsorte und Sprache, mit Englisch als Referenz
Textsorte EN ES FR DE
Code — ×1,20 ×1,30 ×1,46
Verträge — ×1,16 ×1,23 ×1,31
Geschäftliche E-Mails — ×1,12 ×1,22 ×1,17
Support-Tickets — ×1,24 ×1,40 ×1,25

Englisch ist die Referenz: Jede Zahl gibt an, um wie viel mehr Tokens derselbe Inhalt in dieser Sprache kostet. Durchschnitt über das gesamte Korpus: DE ×1,31.

Rechner

Wo es passt

Passt heißt: Modell, Kontextspeicher und Arbeitsreserve passen beim angegebenen Kontext gemeinsam hinein und lassen dem System seinen Anteil. 4 von den 18 getesteten Rechnern (IQ4_XS, 8k Tokens).

Die 18 getesteten Rechner, mit dem Speicher, den jeder frei lässt, und dem größten Kontext, den dieses Modell dort hält
Rechner Passt Freier Speicher Größter Kontext, der passt
PC mit RTX 4060 8 GB nein 7,20 GiB —
PC mit RTX 3060 12 GB nein 11,20 GiB —
PC mit RTX 4070 12 GB nein 11,20 GiB —
Mac mit M4 und 16 GB Unified Memory nein 13,00 GiB —
Büro-Notebook, nur CPU, 16 GB nein 13,00 GiB —
Mac mini mit M6 und 16 GB Unified Memory nein 13,00 GiB —
Mac mit M4 Pro und 24 GB nein 21,00 GiB —
Workstation mit RTX 4090 24 GB nein 23,20 GiB —
Mini-PC mit NPU und 32 GB LPDDR5X nein 29,00 GiB —
Mac mini mit M6 und 32 GB Unified Memory nein 29,00 GiB —
Server mit 2× RTX 3090 (48 GB) nein 47,20 GiB —
Mac mit M4 Max und 64 GB nein 61,00 GiB —
Mac mini mit M5 Pro und 64 GB Unified Memory nein 61,00 GiB —
Xiaomi AI Cube, 80 GB — Technikprototyp nein 77,00 GiB —
PC mit Ryzen AI Max+ 395 und 128 GB Unified Memory ja 96,00 GiB 128k
Mac Studio mit M5 Max und 128 GB Unified Memory ja 125,00 GiB 256k
PC mit Ryzen AI Max+ PRO 495 und 192 GB Unified Memory ja 160,00 GiB 256k
Mac Studio mit M5 Ultra und 512 GB Unified Memory ja 509,00 GiB 256k

Ein Teil dieses Modells verhält sich je nach Programm unterschiedlich. 26,82 GiB der IQ4_XS-Datei sind eine N-Gramm-Tabelle (per_layer_token_embd), aus der immer nur wenige Zeilen auf einmal gelesen werden. llama.cpp v0.5.0 und neuer lassen sie standardmäßig auf der Festplatte und lesen diese Zeilen bei Bedarf, sodass im Speicher nur noch 60,43 GiB Platz finden müssen. Auf dieser Grundlage würde es auch auf Xiaomi AI Cube, 80 GB — Technikprototyp passen, bis 256k Tokens Kontext. Am knappsten verfehlt: Mac mit M4 Max und 64 GB · Mac mini mit M5 Pro und 64 GB Unified Memory, um 0,20 GiB. Die Tabelle oben zählt die ganze Datei, denn das gilt für jedes Programm; die Ersparnis ist nur für llama.cpp v0.5.0 geprüft, im Code und im Dateikopf. Derselbe Code kennzeichnet die Unterstützung dieser Architektur als vorläufig, bis zu einer vollständigen Neuimplementierung (gelesen am 29. September 2026).