AccueilGuidesQuelle carte graphique pour une IA en local : ce qui tient vraiment, en français

Choisir · Guide

Quelle carte graphique pour une IA en local : ce qui tient vraiment, en français

Avec un contrat de 12 000 mots, une RTX 4060 fait tenir 4 modèles en anglais et 3 en français. La langue change ce qui tient, et voici le tableau qui le mesure.

Mesuré et rédigé par Local AI ScopePublié le Chiffres mesurés par Local AI Scope

Un modèle tient quand son fichier de poids, sa mémoire de contexte et la marge du programme qui l’exécute entrent ensemble dans ce qui reste une fois que le système a pris sa part. Avec une carte de 8 Go, 5 des 18 modèles mesurés tiennent à 8k de contexte, et il n’en reste que 3 avec un contrat de 12 000 mots en français.

C’est cette seconde ligne que cette page calcule, et le reste explique d’où elle sort.

Combien de mémoire reste-t-il réellement ?

Une machine de 16 Go n’offre pas 16 Go. Nous réservons 0,8 Gio sur les cartes graphiques dédiées et 3 Gio en mémoire unifiée ou système.

Machine Mémoire pour le modèle Tiennent à 8k Tiennent à 32k
PC avec RTX 4060 8 Go 7,20 Gio 5 sur 18 3 sur 18
PC avec RTX 3060 12 Go 11,20 Gio 6 sur 18 6 sur 18
PC avec RTX 4070 12 Go 11,20 Gio 6 sur 18 6 sur 18
Mac avec M4 et 16 Go unifiés 13,00 Gio 7 sur 18 7 sur 18
Portable de bureau, processeur seul, 16 Go 13,00 Gio 7 sur 18 7 sur 18
Mac avec M4 Pro et 24 Go 21,00 Gio 13 sur 18 11 sur 18
Station avec RTX 4090 24 Go 23,20 Gio 14 sur 18 13 sur 18
Mini-PC avec NPU et 32 Go LPDDR5X 29,00 Gio 14 sur 18 14 sur 18
Mac avec M4 Max et 64 Go 61,00 Gio 15 sur 18 15 sur 18

Calculé par Local AI Scope. « Tient » = poids + mémoire de contexte + marge du programme ≤ mémoire disponible, avec le fichier en Q4_K_M ou dans la compression la plus proche publiée par l’auteur. Retenir Q4_K_M comme plancher est un critère éditorial déclaré, pas une mesure : en dessous la qualité se dégrade, mais de combien, nous ne l’avons pas mesuré.

Aucune machine n’atteint 18. Trois modèles ne tiennent sur aucune des dix : glm-5.2 (433,83 Gio), deepseek-v4-flash (127,28 Gio) et llama4-scout-17b (60,87 Gio). Le plafond réel est de 15 sur 18.

Passer de 8 à 12 Go ajoute exactement un modèle, gemma4-12b : la liste des 12 Go contient celle des 8 Go plus un. Ce que ce palier achète vraiment, c’est de la marge. Le palier qui change la donne est celui de 24 Go, où l’on passe de 6 à 14.

Où la comparaison en anglais cesse de valoir

Le contexte se réserve en tokens, et le même texte ne fait pas le même nombre de tokens en français qu’en anglais : de 1,27 à 1,46 fois plus selon le modèle, mesuré avec le tokeniseur réel de chacun sur un corpus parallèle propre (sha256[:16] 2f6c96b6ea0b161f).

Avec un contrat de 12 000 mots :

Machine Anglais Français Allemand
PC avec RTX 4060 8 Go 4 3 2
PC avec RTX 3060 12 Go 6 6 3
PC avec RTX 4070 12 Go 6 6 3
Mac avec M4 et 16 Go 7 7 4
Portable sans GPU, 16 Go 7 7 4
Mac avec M4 Pro et 24 Go 12 11 9
Station avec RTX 4090 24 Go 14 13 10
Serveur 2× RTX 3090 (48 Go) 14 14 12
Mac avec M4 Max et 64 Go 15 15 13

Mesuré par Local AI Scope. Document de type contrat, 600 mots de réponse ; même critère d’ajustement que le tableau précédent.

Le français coûte un modèle sur trois des neuf machines : celle de 8 Go, le M4 Pro et la RTX 4090. L’allemand en perd sur les neuf. Et en mesurant par pas de 100 mots avec un document de type contrat, le français ne retire aucun modèle avant 4 200 mots, là où l’allemand commence dès 2 600.

Un modèle français se distingue sur le français

La pénalité suit la taille du vocabulaire du tokeniseur, pas la marque : les grands vocabulaires de 2026 se tiennent entre 1,27 et 1,29 en français, les petits paient de 1,29 à 1,46. Une ligne mérite d’être lue à part, et c’est la plus intéressante ici.

Modèle Vocabulaire Français Allemand
gemma4-12b 262 144 1,27 1,33
gpt-oss-20b 201 088 1,28 1,29
mistral-small-24b 131 072 1,29 1,40
glm-5.2 154 880 1,40 1,49
qwen3-8b 151 936 1,46 1,62

Mesuré par Local AI Scope, corpus parallèle sha256[:16] 2f6c96b6ea0b161f.

mistral-small-24b a le plus petit vocabulaire du tableau, 131 072 entrées, et se place pourtant à 1,29 en français, au niveau de modèles au vocabulaire deux fois plus grand. Sur l’allemand, le même modèle retombe à 1,40, derrière les deux grands vocabulaires du tableau. Un tokeniseur entraîné avec une langue en tête se voit dans les chiffres de cette langue, et celui-ci tient en 13,35 Gio.

Ce qu’il faut vérifier avant de payer

  • La quantité de mémoire, pas le numéro de la carte. Une RTX 4070 12 Go et une RTX 3060 12 Go font tenir exactement les mêmes six modèles. La 4070 les exécute plus vite, elle n’en fait tenir aucun de plus.
  • La taille réelle du fichier publié, pas le nombre de paramètres. gemma4-12b pèse 6,63 Gio et qwen3-coder-30b pèse 17,28 Gio : le second n’entre dans aucune machine de 12 Go.
  • La mémoire unifiée d’un Mac n’est pas de la mémoire graphique. Un Mac de 16 Go laisse 13 Gio et fait tenir sept modèles, deux de plus qu’une 4060 de 8 Go, nettement moins vite.
  • La bande passante décide de la vitesse, pas de ce qui tient. Le portable sans carte graphique fait tenir les sept mêmes modèles que le Mac M4 16 Go, à 83 Go/s contre 120 Go/s.

Ce qui n’est pas mesuré ici

Nous mesurons le coût de la langue en tokens et ce qu’il oblige à réserver. Nous ne mesurons pas la qualité des réponses en français : cela exige d’exécuter les modèles et d’évaluer leurs sorties, avec un GPU dont nous ne disposons pas. Appeler « benchmark » une formule est précisément l’erreur que ce site existe pour éviter.

Les vitesses affichées à côté de chaque résultat sont estimées, à partir de la bande passante annoncée par le fabricant. Elles ne décident jamais si un modèle tient.

Calculez avec votre machine

Le trouveur de modèles refait ce calcul avec votre machine, votre document et votre langue pour les 18 modèles, entièrement dans votre navigateur : ce que vous décrivez n’en sort pas. Pour partir du matériel, les fiches machine donnent les deux listes, ce qui tient et ce qui ne tient pas. Le programme qui exécute le modèle compte aussi : voir les fiches logiciels.