Accueil›Modèles›qwen3.8-flash-next

Fiche de modèle

qwen3.8-flash-next

Architecture mélange d’experts48 CouchesLicence qwen-community-1.0Contexte maximal 256kVocabulaire 248.320

En IQ4_XS, c’est un fichier de 87,25 Gio et il tient sur 4 des 18 machines que nous mesurons. Ici, c’est le fichier qui remplit la mémoire : même à son contexte maximal de 256k tokens, le contexte ajoute 6,00 Gio — et le même contenu coûte en français ×1,29 les tokens de l’anglais (en allemand, ×1,31).

En un coup d’œil
Taille en IQ4_XS87,25 GiB
Mémoire de contexte à 8k0,19 GiB
Tient sur4 / 18
Coût de l’allemand×1,31
Plus petite machine qui l’acceptePC avec Ryzen AI Max+ 395 et 128 Go unifiés
87,25 GiB

Taille du modèle en IQ4_XS

Mesuré par Local AI Scope

0,19 GiB

Mémoire de contexte à 8k tokens

Mesuré par Local AI Scope

×1,31

Ce que coûte l’allemand face à l’anglais

Mesuré par Local AI Scope

Tailles

Tailles des fichiers publiés

Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.

Taille du fichier publié pour chaque compression
Compression Taille du modèle
Q8_0 175,30 GiB
IQ4_XS 87,25 GiB

Ce modèle lit aussi les images. Il lui faut pour cela un second fichier, le projecteur de vision (mmproj-F16.gguf, 0,84 Gio), publié à côté du modèle et non compté dans les chiffres de cette page : ils ne comptent que le texte. Si vous comptez lui envoyer des images, ajoutez-le à la taille du modèle.

Contexte

Mémoire de contexte

Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs. En plus de cette mémoire, ce modèle garde un second cache, plus petit, pour l’indexeur de son attention clairsemée : environ 3 Kio par token, 0,02 Gio à 8k et 0,75 Gio à son contexte maximal. Il est dérivé du code et de l’en-tête du fichier, pas déclaré par l’auteur, et il n’est pas ajouté aux chiffres de cette page. Même ajouté, il ne change aucun verdict du tableau des machines.

  • 8k tokens → 0,19 GiB
  • 32k tokens → 0,75 GiB
  • 128k tokens → 3,00 GiB
Langues

Ce qu’il coûte dans chaque langue

Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.

Coût en tokens par type de texte et par langue, l’anglais servant de référence
Type de texte EN ES FR DE
Code — ×1,20 ×1,30 ×1,46
Contrats — ×1,16 ×1,23 ×1,31
Courriels d’entreprise — ×1,12 ×1,22 ×1,17
Tickets d’assistance — ×1,24 ×1,40 ×1,25

L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,31.

Machines

Où il tient

Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 4 sur les 18 machines testées (IQ4_XS, 8k tokens).

Les 18 machines testées, avec la mémoire que chacune laisse et le plus grand contexte que ce modèle y tient
Machine Tient Mémoire restante Plus grand contexte qui tient
PC avec RTX 4060 8 Go non 7,20 GiB —
PC avec RTX 3060 12 Go non 11,20 GiB —
PC avec RTX 4070 12 Go non 11,20 GiB —
Mac avec M4 et 16 Go unifiés non 13,00 GiB —
Portable de bureau, processeur seul, 16 Go non 13,00 GiB —
Mac mini avec M6 et 16 Go unifiés non 13,00 GiB —
Mac avec M4 Pro et 24 Go non 21,00 GiB —
Station de travail avec RTX 4090 24 Go non 23,20 GiB —
Mini-PC avec NPU et 32 Go LPDDR5X non 29,00 GiB —
Mac mini avec M6 et 32 Go unifiés non 29,00 GiB —
Serveur avec 2× RTX 3090 (48 Go) non 47,20 GiB —
Mac avec M4 Max et 64 Go non 61,00 GiB —
Mac mini avec M5 Pro et 64 Go unifiés non 61,00 GiB —
Xiaomi AI Cube, 80 Go — prototype d’ingénierie non 77,00 GiB —
PC avec Ryzen AI Max+ 395 et 128 Go unifiés oui 96,00 GiB 128k
Mac Studio avec M5 Max et 128 Go unifiés oui 125,00 GiB 256k
PC avec Ryzen AI Max+ PRO 495 et 192 Go unifiés oui 160,00 GiB 256k
Mac Studio avec M5 Ultra et 512 Go unifiés oui 509,00 GiB 256k

Une partie de ce modèle se comporte différemment selon le programme qui l’exécute. 26,82 Gio du fichier IQ4_XS forment une table de n-grammes (per_layer_token_embd) dont on ne lit jamais que quelques lignes à la fois. llama.cpp v0.5.0 et les versions suivantes la laissent sur le disque par défaut et lisent ces lignes à la demande : ce qui doit tenir en mémoire tombe alors à 60,43 Gio. Sur cette base, il tiendrait aussi sur Xiaomi AI Cube, 80 Go — prototype d’ingénierie, jusqu’à 256k tokens de contexte. Le plus près de tenir : Mac avec M4 Max et 64 Go · Mac mini avec M5 Pro et 64 Go unifiés, à 0,20 Gio près. Le tableau ci-dessus compte le fichier entier, car c’est ce qui vaut pour tous les programmes ; l’économie n’est vérifiée que pour llama.cpp v0.5.0, dans son code et dans l’en-tête du fichier. Ce même code qualifie sa prise en charge de cette architecture de provisoire, en attente d’une réécriture complète (lu le 29 septembre 2026).