Accueil›Modèles›qwen3.8-flash-next
qwen3.8-flash-next
Architecture mélange d’experts48 CouchesLicence qwen-community-1.0Contexte maximal 256kVocabulaire 248.320
En IQ4_XS, c’est un fichier de 87,25 Gio et il tient sur 4 des 18 machines que nous mesurons. Ici, c’est le fichier qui remplit la mémoire : même à son contexte maximal de 256k tokens, le contexte ajoute 6,00 Gio — et le même contenu coûte en français ×1,29 les tokens de l’anglais (en allemand, ×1,31).
Taille du modèle en IQ4_XS
Mesuré par Local AI Scope
Mémoire de contexte à 8k tokens
Mesuré par Local AI Scope
Ce que coûte l’allemand face à l’anglais
Mesuré par Local AI Scope
Tailles des fichiers publiés
Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.
| Compression | Taille du modèle |
|---|---|
Q8_0 |
175,30 GiB |
IQ4_XS |
87,25 GiB |
Ce modèle lit aussi les images. Il lui faut pour cela un second fichier, le projecteur de vision (mmproj-F16.gguf, 0,84 Gio), publié à côté du modèle et non compté dans les chiffres de cette page : ils ne comptent que le texte. Si vous comptez lui envoyer des images, ajoutez-le à la taille du modèle.
Mémoire de contexte
Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs. En plus de cette mémoire, ce modèle garde un second cache, plus petit, pour l’indexeur de son attention clairsemée : environ 3 Kio par token, 0,02 Gio à 8k et 0,75 Gio à son contexte maximal. Il est dérivé du code et de l’en-tête du fichier, pas déclaré par l’auteur, et il n’est pas ajouté aux chiffres de cette page. Même ajouté, il ne change aucun verdict du tableau des machines.
- 8k tokens → 0,19 GiB
- 32k tokens → 0,75 GiB
- 128k tokens → 3,00 GiB
Ce qu’il coûte dans chaque langue
Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.
| Type de texte | EN | ES | FR | DE |
|---|---|---|---|---|
| Code | — | ×1,20 | ×1,30 | ×1,46 |
| Contrats | — | ×1,16 | ×1,23 | ×1,31 |
| Courriels d’entreprise | — | ×1,12 | ×1,22 | ×1,17 |
| Tickets d’assistance | — | ×1,24 | ×1,40 | ×1,25 |
L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,31.
Où il tient
Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 4 sur les 18 machines testées (IQ4_XS, 8k tokens).
Une partie de ce modèle se comporte différemment selon le programme qui l’exécute. 26,82 Gio du fichier IQ4_XS forment une table de n-grammes (per_layer_token_embd) dont on ne lit jamais que quelques lignes à la fois. llama.cpp v0.5.0 et les versions suivantes la laissent sur le disque par défaut et lisent ces lignes à la demande : ce qui doit tenir en mémoire tombe alors à 60,43 Gio. Sur cette base, il tiendrait aussi sur Xiaomi AI Cube, 80 Go — prototype d’ingénierie, jusqu’à 256k tokens de contexte. Le plus près de tenir : Mac avec M4 Max et 64 Go · Mac mini avec M5 Pro et 64 Go unifiés, à 0,20 Gio près. Le tableau ci-dessus compte le fichier entier, car c’est ce qui vaut pour tous les programmes ; l’économie n’est vérifiée que pour llama.cpp v0.5.0, dans son code et dans l’en-tête du fichier. Ce même code qualifie sa prise en charge de cette architecture de provisoire, en attente d’une réécriture complète (lu le 29 septembre 2026).
