Quelle IA locale pouvez-vous vraiment faire tourner ?
Indiquez la machine dont vous disposez, ce sur quoi vous travaillez et le degré de sensibilité de ce travail. La réponse arrive en mesures : ce qui tient, le contexte que vous pouvez vous permettre, le temps d'attente, et si le local est seulement le bon choix.
Trois chiffres qu’aucun calculateur de VRAM ne montre
Chacun est reproductible à partir de la méthode publiée, et chacun change une décision que quelqu’un s’apprête à prendre.
De combien la formule générique de VRAM surestime la mémoire d’un modèle de 2026 à 32k de contexte. La plupart des calculateurs l’utilisent encore et annoncent donc qu’un modèle ne tient pas alors qu’il tient.
Mesuré par Local AI ScopeCe que coûte le même document en allemand plutôt qu’en anglais, en tokens, avec la famille Qwen3. Les tokens se paient en contexte, en mémoire et sur la facture cloud.
Mesuré par Local AI ScopeSur 640 situations testées où changer la seule langue change la quantité de contexte à réserver. Dans 14,4 % des cas, cela change carrément le modèle recommandé.
Mesuré par Local AI ScopeCinq portes d’entrée, selon ce que vous savez déjà
Chacune aboutit à une fiche avec ses mesures et sa date, pas à un formulaire d’inscription.
Vous donnez votre machine, il répond par des mesures
Votre GPU ou votre Mac, le type de travail, la sensibilité des données et la langue dans laquelle vous écrivez. Il indique ce qui tient, à quel contexte, le temps jusqu’au premier mot et si le local est le bon choix. Pas d’e-mail, pas de compte, rien ne quitte votre navigateur.
10 profils de machine · 18 modèles · 4 languesModèlesChaque modèle mesuré sur les fichiers réellement publiés
Pas des paramètres multipliés par des bits : le fichier que l’auteur a publié, plus la mémoire de contexte calculée couche par couche.
1,03 → 433,83 GiBMatérielDix machines, et ce qu’il reste vraiment
Combien de mémoire survit une fois que le système a pris sa part, et quels modèles tiennent dans le reste — avec les deux listes, ceux qui tiennent et ceux qui ne tiennent pas.
7,20 → 61,00 GiB restantsRuntimesCinq programmes, lus dans leur code source
La télémétrie par défaut, qui d’autre ils appellent, sur quelle adresse ils écoutent, et si quelqu’un hors de l’entreprise peut le vérifier.
3 sur 5 auditablesGuidesLes réponses longues, calculs à l’appui
Pourquoi la formule habituelle exagère le cache, ce que coûte un token dans votre langue et quelle carte vaut son prix.
Méthode montrée, pas à pasD'où vient chaque chiffre
La taille de chaque modèle est celle du fichier réel publié par son auteur. La mémoire de contexte est calculée à partir du schéma d'attention déclaré couche par couche dans la configuration officielle, et non de la formule générique : sur gemma-4-12B à 32k, cette formule donne 12,00 GiB là où la mémoire réelle est de 2,31 GiB. Le coût de chaque langue est mesuré en exécutant le tokenizer de chaque modèle sur un corpus parallèle : le même contenu dans les quatre langues.
Ce qui n'est pas encore mesuré : si un modèle écrit mieux en français ou en allemand. Cela exige de les exécuter et de les évaluer, et tant que cette mesure n'existe pas, cet outil ne l'affirme pas. Les vitesses sont des estimations issues des spécifications du fabricant ; elles ne décident jamais si quelque chose tient.
Ce qu’on demande avant de faire confiance à un chiffre ici
Pourquoi votre calculateur dit-il qu’un modèle tient quand d’autres disent le contraire ?
Parce que le cache de contexte est calculé à partir du motif d’attention que chaque modèle déclare couche par couche, et non avec la formule du manuel. gemma4-12b déclare 48 couches, dont 8 seulement en attention complète ; les 40 autres glissent sur 1024 tokens et n’en retiennent jamais plus. À 32k, cela fait 2,31 GiB de cache réel contre les 12,00 GiB que renvoie la formule générique.
La langue dans laquelle je travaille change-t-elle vraiment le modèle à faire tourner ?
Oui, et c’est mesuré, pas débattu. Le même contrat de 12 000 mots coûte ×1,62 plus de tokens en allemand qu’en anglais avec la famille Qwen3. Dans 30,6 % des 640 situations testées, changer la seule langue change la quantité de contexte à réserver ; dans 14,4 %, cela change carrément le modèle recommandé.
Savez-vous si un modèle écrit mieux en français ou en allemand ?
Non, et ce site ne le prétend pas. Mesurer la qualité des réponses par langue suppose d’exécuter et d’évaluer les modèles, ce que nous n’avons pas fait. Ce qui est mesuré ici, c’est ce qu’une langue coûte en tokens — et les tokens, c’est ce que vous payez en contexte, en mémoire et sur une facture cloud. Tout propos sur la qualité serait un avis déguisé en chiffre.
Ce que je saisis dans l’outil quitte-t-il mon navigateur ?
Non. Le Model Finder calcule tout en local à partir d’un jeu de données que la page a déjà téléchargé. Il n’y a ni compte, ni champ e-mail, ni requête emportant vos réponses. Les deux polices sont hébergées sur le site pour la même raison : rien sur cette page ne demande quoi que ce soit à un tiers.
Voyez ce que votre machine peut faire tourner
Dix profils de machine, dix-huit modèles, quatre langues. L’outil répond dans votre navigateur et indique d’où vient chaque chiffre.
Trouver une configuration pour ma machine