Mesuré, pas estimé

Quelle IA locale pouvez-vous vraiment faire tourner ?

Indiquez la machine dont vous disposez, ce sur quoi vous travaillez et le degré de sensibilité de ce travail. La réponse arrive en mesures : ce qui tient, le contexte que vous pouvez vous permettre, le temps d'attente, et si le local est seulement le bon choix.

Trouver une configuration pour ma machine

Le catalogue mesuré
Modèles avec fiche18
Plus petit / plus grand1,03 / 433,83 GiB
Tiennent dans 8 Go5 sur 18
Langue la plus chèreDE ×1,62
Date de la mesure2026-08-25
18modèles mesurés
10profils de machine
5runtimes
4langues
Pourquoi ce site existe

Trois chiffres qu’aucun calculateur de VRAM ne montre

Chacun est reproductible à partir de la méthode publiée, et chacun change une décision que quelqu’un s’apprête à prendre.

×5.2

De combien la formule générique de VRAM surestime la mémoire d’un modèle de 2026 à 32k de contexte. La plupart des calculateurs l’utilisent encore et annoncent donc qu’un modèle ne tient pas alors qu’il tient.

Mesuré par Local AI Scope
×1.62

Ce que coûte le même document en allemand plutôt qu’en anglais, en tokens, avec la famille Qwen3. Les tokens se paient en contexte, en mémoire et sur la facture cloud.

Mesuré par Local AI Scope
30.6%

Sur 640 situations testées où changer la seule langue change la quantité de contexte à réserver. Dans 14,4 % des cas, cela change carrément le modèle recommandé.

Mesuré par Local AI Scope
Provenance

D'où vient chaque chiffre

La taille de chaque modèle est celle du fichier réel publié par son auteur. La mémoire de contexte est calculée à partir du schéma d'attention déclaré couche par couche dans la configuration officielle, et non de la formule générique : sur gemma-4-12B à 32k, cette formule donne 12,00 GiB là où la mémoire réelle est de 2,31 GiB. Le coût de chaque langue est mesuré en exécutant le tokenizer de chaque modèle sur un corpus parallèle : le même contenu dans les quatre langues.

Ce qui n'est pas encore mesuré : si un modèle écrit mieux en français ou en allemand. Cela exige de les exécuter et de les évaluer, et tant que cette mesure n'existe pas, cet outil ne l'affirme pas. Les vitesses sont des estimations issues des spécifications du fabricant ; elles ne décident jamais si quelque chose tient.

Mesuré par Local AI ScopeVérifié par la communautéEstiméDéclaré par le fabricantPérimé

Lire la méthode complète

Questions

Ce qu’on demande avant de faire confiance à un chiffre ici

Pourquoi votre calculateur dit-il qu’un modèle tient quand d’autres disent le contraire ?

Parce que le cache de contexte est calculé à partir du motif d’attention que chaque modèle déclare couche par couche, et non avec la formule du manuel. gemma4-12b déclare 48 couches, dont 8 seulement en attention complète ; les 40 autres glissent sur 1024 tokens et n’en retiennent jamais plus. À 32k, cela fait 2,31 GiB de cache réel contre les 12,00 GiB que renvoie la formule générique.

La langue dans laquelle je travaille change-t-elle vraiment le modèle à faire tourner ?

Oui, et c’est mesuré, pas débattu. Le même contrat de 12 000 mots coûte ×1,62 plus de tokens en allemand qu’en anglais avec la famille Qwen3. Dans 30,6 % des 640 situations testées, changer la seule langue change la quantité de contexte à réserver ; dans 14,4 %, cela change carrément le modèle recommandé.

Savez-vous si un modèle écrit mieux en français ou en allemand ?

Non, et ce site ne le prétend pas. Mesurer la qualité des réponses par langue suppose d’exécuter et d’évaluer les modèles, ce que nous n’avons pas fait. Ce qui est mesuré ici, c’est ce qu’une langue coûte en tokens — et les tokens, c’est ce que vous payez en contexte, en mémoire et sur une facture cloud. Tout propos sur la qualité serait un avis déguisé en chiffre.

Ce que je saisis dans l’outil quitte-t-il mon navigateur ?

Non. Le Model Finder calcule tout en local à partir d’un jeu de données que la page a déjà téléchargé. Il n’y a ni compte, ni champ e-mail, ni requête emportant vos réponses. Les deux polices sont hébergées sur le site pour la même raison : rien sur cette page ne demande quoi que ce soit à un tiers.

Une question, une réponse

Voyez ce que votre machine peut faire tourner

Dix profils de machine, dix-huit modèles, quatre langues. L’outil répond dans votre navigateur et indique d’où vient chaque chiffre.

Trouver une configuration pour ma machine