Un modèle tient quand son fichier de poids, sa mémoire de contexte et la marge du programme qui l’exécute entrent ensemble dans ce qui reste une fois que le système a pris sa part. Avec une carte de 8 Go, 5 des 18 modèles mesurés tiennent à 8k de contexte, et il n’en reste que 3 avec un contrat de 12 000 mots en français.
C’est cette seconde ligne que cette page calcule, et le reste explique d’où elle sort.
Combien de mémoire reste-t-il réellement ?
Une machine de 16 Go n’offre pas 16 Go. Nous réservons 0,8 Gio sur les cartes graphiques dédiées et 3 Gio en mémoire unifiée ou système.
| Machine | Mémoire pour le modèle | Tiennent à 8k | Tiennent à 32k |
|---|---|---|---|
| PC avec RTX 4060 8 Go | 7,20 Gio | 5 sur 18 | 3 sur 18 |
| PC avec RTX 3060 12 Go | 11,20 Gio | 6 sur 18 | 6 sur 18 |
| PC avec RTX 4070 12 Go | 11,20 Gio | 6 sur 18 | 6 sur 18 |
| Mac avec M4 et 16 Go unifiés | 13,00 Gio | 7 sur 18 | 7 sur 18 |
| Portable de bureau, processeur seul, 16 Go | 13,00 Gio | 7 sur 18 | 7 sur 18 |
| Mac avec M4 Pro et 24 Go | 21,00 Gio | 13 sur 18 | 11 sur 18 |
| Station avec RTX 4090 24 Go | 23,20 Gio | 14 sur 18 | 13 sur 18 |
| Mini-PC avec NPU et 32 Go LPDDR5X | 29,00 Gio | 14 sur 18 | 14 sur 18 |
| Mac avec M4 Max et 64 Go | 61,00 Gio | 15 sur 18 | 15 sur 18 |
Calculé par Local AI Scope. « Tient » = poids + mémoire de contexte + marge du programme ≤ mémoire disponible, avec le fichier en Q4_K_M ou dans la compression la plus proche publiée par l’auteur. Retenir Q4_K_M comme plancher est un critère éditorial déclaré, pas une mesure : en dessous la qualité se dégrade, mais de combien, nous ne l’avons pas mesuré.
Aucune machine n’atteint 18. Trois modèles ne tiennent sur aucune des dix : glm-5.2 (433,83 Gio), deepseek-v4-flash (127,28 Gio) et llama4-scout-17b (60,87 Gio). Le plafond réel est de 15 sur 18.
Passer de 8 à 12 Go ajoute exactement un modèle, gemma4-12b : la liste des 12 Go contient celle des 8 Go plus un. Ce que ce palier achète vraiment, c’est de la marge. Le palier qui change la donne est celui de 24 Go, où l’on passe de 6 à 14.
Où la comparaison en anglais cesse de valoir
Le contexte se réserve en tokens, et le même texte ne fait pas le même nombre de tokens en français qu’en anglais : de 1,27 à 1,46 fois plus selon le modèle, mesuré avec le tokeniseur réel de chacun sur un corpus parallèle propre (sha256[:16] 2f6c96b6ea0b161f).
Avec un contrat de 12 000 mots :
| Machine | Anglais | Français | Allemand |
|---|---|---|---|
| PC avec RTX 4060 8 Go | 4 | 3 | 2 |
| PC avec RTX 3060 12 Go | 6 | 6 | 3 |
| PC avec RTX 4070 12 Go | 6 | 6 | 3 |
| Mac avec M4 et 16 Go | 7 | 7 | 4 |
| Portable sans GPU, 16 Go | 7 | 7 | 4 |
| Mac avec M4 Pro et 24 Go | 12 | 11 | 9 |
| Station avec RTX 4090 24 Go | 14 | 13 | 10 |
| Serveur 2× RTX 3090 (48 Go) | 14 | 14 | 12 |
| Mac avec M4 Max et 64 Go | 15 | 15 | 13 |
Mesuré par Local AI Scope. Document de type contrat, 600 mots de réponse ; même critère d’ajustement que le tableau précédent.
Le français coûte un modèle sur trois des neuf machines : celle de 8 Go, le M4 Pro et la RTX 4090. L’allemand en perd sur les neuf. Et en mesurant par pas de 100 mots avec un document de type contrat, le français ne retire aucun modèle avant 4 200 mots, là où l’allemand commence dès 2 600.
Un modèle français se distingue sur le français
La pénalité suit la taille du vocabulaire du tokeniseur, pas la marque : les grands vocabulaires de 2026 se tiennent entre 1,27 et 1,29 en français, les petits paient de 1,29 à 1,46. Une ligne mérite d’être lue à part, et c’est la plus intéressante ici.
| Modèle | Vocabulaire | Français | Allemand |
|---|---|---|---|
gemma4-12b |
262 144 | 1,27 | 1,33 |
gpt-oss-20b |
201 088 | 1,28 | 1,29 |
mistral-small-24b |
131 072 | 1,29 | 1,40 |
glm-5.2 |
154 880 | 1,40 | 1,49 |
qwen3-8b |
151 936 | 1,46 | 1,62 |
Mesuré par Local AI Scope, corpus parallèle sha256[:16] 2f6c96b6ea0b161f.
mistral-small-24b a le plus petit vocabulaire du tableau, 131 072 entrées, et se place pourtant à 1,29 en français, au niveau de modèles au vocabulaire deux fois plus grand. Sur l’allemand, le même modèle retombe à 1,40, derrière les deux grands vocabulaires du tableau. Un tokeniseur entraîné avec une langue en tête se voit dans les chiffres de cette langue, et celui-ci tient en 13,35 Gio.
Ce qu’il faut vérifier avant de payer
- La quantité de mémoire, pas le numéro de la carte. Une RTX 4070 12 Go et une RTX 3060 12 Go font tenir exactement les mêmes six modèles. La 4070 les exécute plus vite, elle n’en fait tenir aucun de plus.
- La taille réelle du fichier publié, pas le nombre de paramètres.
gemma4-12bpèse 6,63 Gio etqwen3-coder-30bpèse 17,28 Gio : le second n’entre dans aucune machine de 12 Go. - La mémoire unifiée d’un Mac n’est pas de la mémoire graphique. Un Mac de 16 Go laisse 13 Gio et fait tenir sept modèles, deux de plus qu’une 4060 de 8 Go, nettement moins vite.
- La bande passante décide de la vitesse, pas de ce qui tient. Le portable sans carte graphique fait tenir les sept mêmes modèles que le Mac M4 16 Go, à 83 Go/s contre 120 Go/s.
Ce qui n’est pas mesuré ici
Nous mesurons le coût de la langue en tokens et ce qu’il oblige à réserver. Nous ne mesurons pas la qualité des réponses en français : cela exige d’exécuter les modèles et d’évaluer leurs sorties, avec un GPU dont nous ne disposons pas. Appeler « benchmark » une formule est précisément l’erreur que ce site existe pour éviter.
Les vitesses affichées à côté de chaque résultat sont estimées, à partir de la bande passante annoncée par le fabricant. Elles ne décident jamais si un modèle tient.
Calculez avec votre machine
Le trouveur de modèles refait ce calcul avec votre machine, votre document et votre langue pour les 18 modèles, entièrement dans votre navigateur : ce que vous décrivez n’en sort pas. Pour partir du matériel, les fiches machine donnent les deux listes, ce qui tient et ce qui ne tient pas. Le programme qui exécute le modèle compte aussi : voir les fiches logiciels.