glm-5.2
Architecture dense78 CouchesLicence mitContexte maximal 1.024kVocabulaire 154.880
En Q4_K_M, c’est un fichier de 433,83 Gio et il ne tient sur aucune des 10 machines que nous mesurons à 8k tokens. Ce n’est pas le fichier qui remplit la mémoire : c’est le contexte.
Taille du modèle en Q4_K_M
Mesuré par Local AI Scope
Mémoire de contexte à 8k tokens
Mesuré par Local AI Scope
Ce que coûte l’allemand face à l’anglais
Mesuré par Local AI Scope
Tailles des fichiers publiés
Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.
| Compression | Taille du modèle |
|---|---|
Q8_0 |
746,32 GiB |
Q6_K |
582,88 GiB |
Q5_K_M |
522,31 GiB |
Q5_K_S |
491,05 GiB |
Q4_K_M |
433,83 GiB |
Q4_K_S |
406,46 GiB |
IQ4_XS |
340,22 GiB |
Q3_K_M |
319,20 GiB |
Mémoire de contexte
Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs.
- 8k tokens → 29,25 GiB
- 32k tokens → 117,00 GiB
- 128k tokens → 468,00 GiB
Ce qu’il coûte dans chaque langue
Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.
| Type de texte | EN | ES | FR | DE |
|---|---|---|---|---|
| Code | — | ×1,26 | ×1,41 | ×1,64 |
| Contrats | — | ×1,29 | ×1,36 | ×1,52 |
| Courriels d’entreprise | — | ×1,22 | ×1,32 | ×1,32 |
| Tickets d’assistance | — | ×1,33 | ×1,51 | ×1,41 |
L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,49.
Où il tient
Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 0 sur les 10 machines testées (Q4_K_M, 8k tokens).
| Machine | Tient | Mémoire restante | Plus grand contexte qui tient |
|---|---|---|---|
| PC avec RTX 4060 8 Go | non | 7,20 GiB | — |
| PC avec RTX 3060 12 Go | non | 11,20 GiB | — |
| PC avec RTX 4070 12 Go | non | 11,20 GiB | — |
| Mac avec M4 et 16 Go unifiés | non | 13,00 GiB | — |
| Portable de bureau, processeur seul, 16 Go | non | 13,00 GiB | — |
| Mac avec M4 Pro et 24 Go | non | 21,00 GiB | — |
| Station de travail avec RTX 4090 24 Go | non | 23,20 GiB | — |
| Mini-PC avec NPU et 32 Go LPDDR5X | non | 29,00 GiB | — |
| Serveur avec 2× RTX 3090 (48 Go) | non | 47,20 GiB | — |
| Mac avec M4 Max et 64 Go | non | 61,00 GiB | — |
Aucune des machines que nous mesurons n’accepte ce modèle à la compression de référence, même au plus petit contexte.