Trouveur de modèle

Un modèle qui tient en anglais peut ne pas tenir en allemand.

Les calculateurs de VRAM répondent « ça tient ? » avec une formule qui ignore deux choses : la façon dont les modèles de 2026 stockent réellement la mémoire, et le nombre de tokens qu'il faut pour dire la même chose dans chaque langue. Ici, les deux sont mesurées.

Provenance

D'où vient chaque chiffre

La taille de chaque modèle est celle du fichier réel publié par son auteur. La mémoire de contexte est calculée à partir du schéma d'attention déclaré couche par couche dans la configuration officielle, et non de la formule générique : sur gemma-4-12B à 32k, cette formule donne 12,00 GiB là où la mémoire réelle est de 2,31 GiB. Le coût de chaque langue est mesuré en exécutant le tokenizer de chaque modèle sur un corpus parallèle : le même contenu dans les quatre langues.

Ce qui n'est pas encore mesuré : si un modèle écrit mieux en français ou en allemand. Cela exige de les exécuter et de les évaluer, et tant que cette mesure n'existe pas, cet outil ne l'affirme pas. Les vitesses sont des estimations issues des spécifications du fabricant ; elles ne décident jamais si quelque chose tient.