AccueilModèlesgemma4-e4b

Fiche de modèle

gemma4-e4b

Architecture dense42 CouchesLicence apache-2.0Contexte maximal 128kVocabulaire 262.144

En Q4_K_M, c’est un fichier de 4,63 Gio et il tient sur 10 des 10 machines que nous mesurons. Ce qui coûte cher n’est pas le fichier : c’est le contexte — et le même contenu en allemand coûte ×1,33 ce qu’il coûte en anglais.

En un coup d’œil
Taille en Q4_K_M4,63 GiB
Mémoire de contexte à 8k0,14 GiB
Tient sur10 / 10
Coût de l’allemand×1,33
Plus petite machine qui l’acceptePC avec RTX 4060 8 Go
4,63 GiB

Taille du modèle en Q4_K_M

Mesuré par Local AI Scope

0,14 GiB

Mémoire de contexte à 8k tokens

Mesuré par Local AI Scope

×1,33

Ce que coûte l’allemand face à l’anglais

Mesuré par Local AI Scope

Tailles

Tailles des fichiers publiés

Ce sont les tailles des fichiers réellement publiés par son auteur, additionnées lorsque le modèle est livré en plusieurs parties. Pas une estimation à partir du nombre de paramètres.

Taille du fichier publié pour chaque compression
Compression Taille du modèle
Q8_0 7,63 GiB
Q6_K 6,59 GiB
Q5_K_M 5,11 GiB
Q5_K_S 5,03 GiB
Q4_K_M 4,63 GiB
Q4_K_S 4,51 GiB
IQ4_XS 4,39 GiB
Q3_K_M 3,78 GiB
Contexte

Mémoire de contexte

Calculée à partir du schéma d’attention que ce modèle déclare couche par couche, et non de la formule générique. C’est pourquoi le chiffre est souvent bien inférieur à celui d’autres calculateurs.

  • 8k tokens → 0,14 GiB
  • 32k tokens → 0,47 GiB
  • 128k tokens → 1,78 GiB
Langues

Ce qu’il coûte dans chaque langue

Mesuré en exécutant le tokenizer de ce modèle sur le même contenu dans quatre langues. Les tokens sont ce que l’on paie en contexte, en mémoire et sur la facture du cloud.

Coût en tokens par type de texte et par langue, l’anglais servant de référence
Type de texte EN ES FR DE
Code ×1,16 ×1,25 ×1,39
Contrats ×1,15 ×1,22 ×1,36
Courriels d’entreprise ×1,11 ×1,21 ×1,21
Tickets d’assistance ×1,20 ×1,40 ×1,32

L’anglais est la référence : chaque chiffre indique combien de fois plus de tokens coûte le même contenu dans cette langue. Moyenne sur tout le corpus: DE ×1,33.

Machines

Où il tient

Tenir signifie que le modèle, sa mémoire de contexte et la marge de travail tiennent au contexte indiqué, en laissant au système sa part. 10 sur les 10 machines testées (Q4_K_M, 8k tokens).

Les dix machines testées, avec la mémoire que chacune laisse et le plus grand contexte que ce modèle y tient
Machine Tient Mémoire restante Plus grand contexte qui tient
PC avec RTX 4060 8 Go oui 7,20 GiB 32k
PC avec RTX 3060 12 Go oui 11,20 GiB 128k
PC avec RTX 4070 12 Go oui 11,20 GiB 128k
Mac avec M4 et 16 Go unifiés oui 13,00 GiB 128k
Portable de bureau, processeur seul, 16 Go oui 13,00 GiB 128k
Mac avec M4 Pro et 24 Go oui 21,00 GiB 128k
Station de travail avec RTX 4090 24 Go oui 23,20 GiB 128k
Mini-PC avec NPU et 32 Go LPDDR5X oui 29,00 GiB 128k
Serveur avec 2× RTX 3090 (48 Go) oui 47,20 GiB 128k
Mac avec M4 Max et 64 Go oui 61,00 GiB 128k