Méthodologie et étiquettes de preuve
Un nombre sans origine et sans date n’est pas une preuve : c’est une affirmation. Cette page explique d’où vient chaque chiffre de Local AI Scope, ce que signifie chaque étiquette et — tout aussi important — ce qui n’est pas mesuré.
1. Les étiquettes de preuve
Chaque donnée publiée porte l’une de ces cinq étiquettes. Elles se distinguent par le texte et une icône, jamais par la couleur seule.
| Étiquette | Ce que cela signifie exactement | Ce qu’elle permet de soutenir |
|---|---|---|
Measured by Local AI Scope |
Nous l’avons exécuté nous-mêmes, selon un protocole écrit et reproductible : version, machine, configuration et date sont publiées | Oui, y compris une recommandation, en indiquant l’intervalle et le nombre de répétitions |
Community verified |
Envoyé par quelqu’un de l’extérieur et ayant passé les contrôles de cohérence du site ; nous ne l’avons pas exécuté nous-mêmes | Oui, avec la confiance moindre affichée de façon visible |
Estimated |
Résultat d’une formule, pas d’une exécution. La formule est publiée et peut être refaite | À titre indicatif. Jamais présenté comme un banc d’essai |
Vendor declared |
Déclaré par le fabricant dans une source primaire : fiche technique, fichier de configuration ou licence | Pour des faits déclarés (taille, licence, contexte maximal). Pas pour affirmer une performance |
Stale |
La donnée a dépassé sa péremption : une version plus récente existe, ou le prix est ancien | Elle ne soutient aucune recommandation mise en avant. Elle reste visible, avec sa date, à titre d’historique |
2. D’où vient chaque chiffre
Taille du modèle
C’est la taille du fichier réellement publié pour cette quantification, et non le produit des paramètres par les bits. Étiquette : Vendor declared.
Mémoire de contexte
Elle est calculée couche par couche, à partir du schéma d’attention que chaque modèle déclare dans son fichier de configuration officiel. Cela compte bien plus qu’il n’y paraît : les modèles de 2026 n’utilisent plus l’attention complète sur toutes leurs couches, alors que la formule générique employée par la plupart des calculateurs traite toutes les couches de la même façon. Dans un cas vérifié, cette formule générique demandait 12,00 Gio là où le calcul réel sur la configuration publiée donne 2,31 Gio : une surestimation de ×5,2. Traduction : d’autres outils disent à quelqu’un qui a 12 Go qu’un modèle ne tiendra pas, alors qu’il tient. Étiquette : Estimated, formule publiée.
Coût de la langue
C’est la mesure propre du site. On exécute le tokenizer réel de chaque modèle — le programme qui découpe le texte en unités facturées — sur un corpus parallèle interne et versionné : les mêmes textes, de quatre types différents, dans les quatre langues. On compare combien d’unités coûte le fait de dire exactement la même chose dans chaque langue. Étiquette : Measured by Local AI Scope.
Le résultat est que la pénalité liée à la langue ne dépend pas de la famille du modèle mais de la génération de son tokenizer, et qu’elle varie aussi selon le type de texte : avec un même modèle, un contrat en allemand peut coûter nettement plus qu’un courriel en allemand. C’est pourquoi la langue de travail est une entrée de l’outil et non un détail.
Vitesse
C’est une estimation déclarée à partir de la bande passante mémoire et de la puissance de calcul annoncées par le fabricant, avec des hypothèses de rendement. Elle ne décide jamais si un modèle tient ou non ; elle peut faire pencher la voie recommandée quand la machine est juste, et dans ce cas la page le dit sur la ligne même. Étiquette : Estimated.
3. Comment une mesure est identifiée
Une vitesse n’est pas une donnée si l’on ignore sur quoi elle a été mesurée. L’identité d’une mesure, c’est la combinaison complète : modèle, version, artefact, quantification, runtime et sa version, système d’exploitation, pilote, matériel, tâche, langue, protocole et date. Ainsi une nouvelle configuration n’est pas confondue avec une donnée nouvelle, et une amélioration n’est pas enregistrée comme une régression.
4. Les contrôles
Une méthode qui n’est éprouvée que sur les cas qu’elle réussit n’est pas une méthode. Chaque version du moteur de calcul passe deux contrôles opposés avant toute publication :
- Un contrôle positif : une combinaison qui doit tenir et qui doit ressortir comme tenant.
- Un contrôle négatif : une combinaison qui ne peut pas tenir et qui doit ressortir refusée, avec le chiffre qui manque.
Si l’un des deux échoue, rien n’est publié.
5. Ce qui n’est PAS mesuré
Ce qui est mesuré, c’est le coût de la langue, pas la qualité dans cette langue. Savoir qu’un modèle tient et ce qu’il coûte de travailler en allemand ne dit rien de la qualité de ses réponses en allemand : il faudrait exécuter les modèles et évaluer leurs sorties selon un protocole propre, et cela n’a pas encore été fait. Aucune page de ce site n’affirme « qualité linguistique mesurée ». Le jour où cette mesure existera, elle figurera ici avec son protocole, sa date et son étiquette.
6. Péremption et mises à jour
Chaque champ a sa propre péremption : un prix périme avant une licence. Lorsqu’une donnée la dépasse, elle est marquée Stale, cesse de soutenir les recommandations mises en avant et reste visible avec sa date au lieu de disparaître. Toute donnée publiée porte la date de sa dernière vérification.
7. Reproductibilité et corrections
L’objectif est que n’importe qui puisse refaire les calculs : les formules sont publiées, les sources primaires sont liées et le corpus de mesure est versionné avec son empreinte. Si vous reproduisez un chiffre et n’obtenez pas le même, c’est une information précieuse : écrivez à l’adresse des mentions légales. Les corrections sont publiées et datées, comme l’explique la politique éditoriale.