Accueil›Modèles›granite-4.2-8b
granite-4.2-8b
Architecture dense40 CouchesLicence apache-2.0Contexte maximal 128kVocabulaire 100.352
En Q4_K_M, c’est un fichier de 4,98 Gio et il tient sur 18 des 18 machines que nous mesurons. Ce qui coûte cher n’est pas le fichier : c’est le contexte — et le même contenu coûte en français ×1,47 les tokens de l’anglais (en allemand, ×1,61).
Taille du modèle en Q4_K_M
Mesuré par Local AI Scope
Mémoire de contexte à 8k tokens
Mesuré par Local AI Scope
Ce que coûte l’allemand face à l’anglais
Mesuré par Local AI Scope
Tailles des fichiers publiés
Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.
| Compression | Taille du modèle |
|---|---|
Q8_0 |
8,70 GiB |
Q6_K |
6,72 GiB |
Q5_K_M |
5,82 GiB |
Q5_K_S |
5,68 GiB |
Q4_K_M |
4,98 GiB |
Q4_K_S |
4,74 GiB |
Q3_K_M |
4,05 GiB |
Mémoire de contexte
Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs. Le config.json de ce modèle n’indique pas la taille de chaque tête d’attention, et c’est de ce nombre qu’est faite la mémoire de contexte. Nous le dérivons de deux chiffres qu’il déclare, 4.096 unités cachées pour 32 têtes d’attention, ce qui est la définition même de la taille d’une tête et ce que la bibliothèque de référence suppose par défaut : 128. Tous les chiffres de cette section reposent sur cette dérivation, elle est donc signalée ici au lieu d’être passée sous silence.
- 8k tokens → 1,25 GiB
- 32k tokens → 5,00 GiB
- 128k tokens → 20,00 GiB
Ce qu’il coûte dans chaque langue
Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.
| Type de texte | EN | ES | FR | DE |
|---|---|---|---|---|
| Code | — | ×1,22 | ×1,42 | ×1,60 |
| Contrats | — | ×1,39 | ×1,47 | ×1,76 |
| Courriels d’entreprise | — | ×1,27 | ×1,41 | ×1,48 |
| Tickets d’assistance | — | ×1,39 | ×1,63 | ×1,55 |
L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,61.
Où il tient
Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 18 sur les 18 machines testées (Q4_K_M, 8k tokens).
