Accueil›Modèles›granite-4.2-8b

Fiche de modèle

granite-4.2-8b

Architecture dense40 CouchesLicence apache-2.0Contexte maximal 128kVocabulaire 100.352

En Q4_K_M, c’est un fichier de 4,98 Gio et il tient sur 18 des 18 machines que nous mesurons. Ce qui coûte cher n’est pas le fichier : c’est le contexte — et le même contenu coûte en français ×1,47 les tokens de l’anglais (en allemand, ×1,61).

En un coup d’œil
Taille en Q4_K_M4,98 GiB
Mémoire de contexte à 8k1,25 GiB
Tient sur18 / 18
Coût de l’allemand×1,61
Plus petite machine qui l’acceptePC avec RTX 4060 8 Go
4,98 GiB

Taille du modèle en Q4_K_M

Mesuré par Local AI Scope

1,25 GiB

Mémoire de contexte à 8k tokens

Mesuré par Local AI Scope

×1,61

Ce que coûte l’allemand face à l’anglais

Mesuré par Local AI Scope

Tailles

Tailles des fichiers publiés

Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.

Taille du fichier publié pour chaque compression
Compression Taille du modèle
Q8_0 8,70 GiB
Q6_K 6,72 GiB
Q5_K_M 5,82 GiB
Q5_K_S 5,68 GiB
Q4_K_M 4,98 GiB
Q4_K_S 4,74 GiB
Q3_K_M 4,05 GiB
Contexte

Mémoire de contexte

Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs. Le config.json de ce modèle n’indique pas la taille de chaque tête d’attention, et c’est de ce nombre qu’est faite la mémoire de contexte. Nous le dérivons de deux chiffres qu’il déclare, 4.096 unités cachées pour 32 têtes d’attention, ce qui est la définition même de la taille d’une tête et ce que la bibliothèque de référence suppose par défaut : 128. Tous les chiffres de cette section reposent sur cette dérivation, elle est donc signalée ici au lieu d’être passée sous silence.

  • 8k tokens → 1,25 GiB
  • 32k tokens → 5,00 GiB
  • 128k tokens → 20,00 GiB
Langues

Ce qu’il coûte dans chaque langue

Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.

Coût en tokens par type de texte et par langue, l’anglais servant de référence
Type de texte EN ES FR DE
Code — ×1,22 ×1,42 ×1,60
Contrats — ×1,39 ×1,47 ×1,76
Courriels d’entreprise — ×1,27 ×1,41 ×1,48
Tickets d’assistance — ×1,39 ×1,63 ×1,55

L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,61.

Machines

Où il tient

Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 18 sur les 18 machines testées (Q4_K_M, 8k tokens).

Les 18 machines testées, avec la mémoire que chacune laisse et le plus grand contexte que ce modèle y tient
Machine Tient Mémoire restante Plus grand contexte qui tient
PC avec RTX 4060 8 Go oui 7,20 GiB 8k
PC avec RTX 3060 12 Go oui 11,20 GiB 32k
PC avec RTX 4070 12 Go oui 11,20 GiB 32k
Mac avec M4 et 16 Go unifiés oui 13,00 GiB 32k
Portable de bureau, processeur seul, 16 Go oui 13,00 GiB 32k
Mac mini avec M6 et 16 Go unifiés oui 13,00 GiB 32k
Mac avec M4 Pro et 24 Go oui 21,00 GiB 64k
Station de travail avec RTX 4090 24 Go oui 23,20 GiB 64k
Mini-PC avec NPU et 32 Go LPDDR5X oui 29,00 GiB 128k
Mac mini avec M6 et 32 Go unifiés oui 29,00 GiB 128k
Serveur avec 2× RTX 3090 (48 Go) oui 47,20 GiB 128k
Mac avec M4 Max et 64 Go oui 61,00 GiB 128k
Mac mini avec M5 Pro et 64 Go unifiés oui 61,00 GiB 128k
Xiaomi AI Cube, 80 Go — prototype d’ingénierie oui 77,00 GiB 128k
PC avec Ryzen AI Max+ 395 et 128 Go unifiés oui 96,00 GiB 128k
Mac Studio avec M5 Max et 128 Go unifiés oui 125,00 GiB 128k
PC avec Ryzen AI Max+ PRO 495 et 192 Go unifiés oui 160,00 GiB 128k
Mac Studio avec M5 Ultra et 512 Go unifiés oui 509,00 GiB 128k