Accueil›Guides›IA locale en français : ce qui change, ce que ça coûte et ce que vous perdez

Choisir · Guide

IA locale en français : ce qui change, ce que ça coûte et ce que vous perdez

Sur les tickets de support, le français est la langue la plus chère des quatre : 1,40x l’anglais en médiane, devant l’allemand. Mesuré sur 20 modèles, avec ce que ça change à l’écran.

Mesuré et rédigé par Local AI ScopePublié le Chiffres mesurés par Local AI Scope

Presque n’importe quel ordinateur récent peut faire tourner une IA en local. Ce qu’il ne peut pas faire tourner, c’est celle que vous utilisez aujourd’hui. Sur une carte de 8 Go, 6 des 20 modèles que nous mesurons tiennent à côté d’un document de huit pages, et le plus gros pèse 4,98 Gio ; le plus gros de notre catalogue pèse 433,83 Gio. Tout le reste découle de cet écart.

Ce n’est pas une raison d’y renoncer. C’est la raison de savoir ce que vous échangez avant d’y passer une soirée.

Ce qui change vraiment quand le modèle tourne sur votre machine

Quatre choses changent, et seulement quatre.

Rien de ce que vous tapez ne quitte la machine. Ni le document, ni la question, ni le brouillon que vous n’avez pas envoyé. Pas de contrat de sous-traitance à signer, pas de clause de transfert hors UE à relire, pas de case « n’entraînez pas sur mes données » à croire sur parole. Pour tout ce qui relève du RGPD, cela ne réduit pas la démarche : cela la supprime.

Le coût cesse d’être à l’usage. Vous payez une fois la machine et l’électricité. Aucun compteur ne tourne pendant que vous collez un contrat long et redemandez le résumé cinq fois.

Ça marche câble débranché. Une fois le fichier sur le disque, un avion, un site sans réseau ou une infrastructure fermée cessent d’être un obstacle.

Et c’est plus petit et plus lent que ce à quoi vous êtes habitué. C’est la partie qui n’apparaît jamais à côté du prix, alors le reste de cette page lui met des chiffres.

Comment nous comptons, avant tout chiffre

Tous les chiffres de cette page utilisent une compression par modèle : Q4_K_M lorsque l’auteur la publie, le voisin le plus proche sinon. Q4_K_M est notre plancher de qualité, parce qu’en dessous la perte s’entend dans les réponses.

Cela a une conséquence qu’il faut dire clairement : un modèle qui ne tiendrait sur votre machine qu’avec une compression plus agressive est compté ici comme ne tenant pas. Nous pourrions publier un chiffre plus flatteur en relâchant la compression. Nous ne le faisons pas, et c’est la règle qu’utilisent aussi les fiches matériel et les fiches de modèle : les comptes de ce site ne se contredisent pas entre eux.

Combien plus petit, exactement

Un modèle local est un fichier, et ce fichier doit tenir dans ce qui reste de mémoire une fois que le système a pris sa part, en même temps que la mémoire occupée par la conversation et la marge de travail du programme. Nous réservons 0,8 Gio sur les cartes graphiques dédiées et 3 Gio en mémoire unifiée ou système. Sur les PC avec Ryzen AI Max+, c’est une autre limite qui compte : AMD ne laisse au processeur graphique que 96 Gio sur 128 Go et 160 Gio sur 192 Go.

Avec un document de 4 000 mots en français :

Machine Mémoire pour le modèle Modèles qui tiennent Le plus gros Poids Distance à glm-5.2
PC avec RTX 4060 8 Go 7,20 Gio 6 sur 20 granite-4.2-8b 4,98 Gio ×87
PC avec RTX 3060 12 Go 11,20 Gio 7 sur 20 gemma4-12b 6,63 Gio ×65
PC avec RTX 4070 12 Go 11,20 Gio 7 sur 20 gemma4-12b 6,63 Gio ×65
Mac avec M4 et 16 Go unifiés 13,00 Gio 8 sur 20 gpt-oss-20b 10,83 Gio ×40
Portable de bureau, 16 Go, sans carte 13,00 Gio 8 sur 20 gpt-oss-20b 10,83 Gio ×40
Mac mini avec M6 et 16 Go 13,00 Gio 8 sur 20 gpt-oss-20b 10,83 Gio ×40
Mac avec M4 Pro et 24 Go 21,00 Gio 14 sur 20 qwen3-coder-30b 17,28 Gio ×25
Station avec RTX 4090 24 Go 23,20 Gio 15 sur 20 qwen3.6-35b-a3b 20,61 Gio ×21
Mini-PC avec NPU et 32 Go 29,00 Gio 15 sur 20 qwen3.6-35b-a3b 20,61 Gio ×21
Mac mini avec M6 et 32 Go 29,00 Gio 15 sur 20 qwen3.6-35b-a3b 20,61 Gio ×21
Serveur 2× RTX 3090 (48 Go) 47,20 Gio 15 sur 20 qwen3.6-35b-a3b 20,61 Gio ×21
Mac avec M4 Max et 64 Go 61,00 Gio 16 sur 20 gpt-oss-120b 58,46 Gio ×7
Mac mini avec M5 Pro et 64 Go 61,00 Gio 16 sur 20 gpt-oss-120b 58,46 Gio ×7
Xiaomi AI Cube, 80 Go (prototype) 77,00 Gio 17 sur 20 llama4-scout-17b 60,87 Gio ×7
PC avec Ryzen AI Max+ 395 et 128 Go 96,00 Gio 18 sur 20 qwen3.8-flash-next 87,25 Gio ×5
Mac Studio avec M5 Max et 128 Go 125,00 Gio 18 sur 20 qwen3.8-flash-next 87,25 Gio ×5
PC avec Ryzen AI Max+ PRO 495 et 192 Go 160,00 Gio 19 sur 20 deepseek-v4-flash 127,28 Gio ×3
Mac Studio avec M5 Ultra et 512 Go 509,00 Gio 20 sur 20 glm-5.2 433,83 Gio ×1

Calculé par Local AI Scope à partir des tailles de fichier publiées et du schéma d’attention réel de chaque modèle, toutes les lignes à la même compression de référence pour que les tailles soient comparables. Les tailles proviennent des versions publiées par les auteurs : glm-5.2, gemma4-12b, gpt-oss-20b. glm-5.2 pèse 433,83 Gio en Q4_K_M ; la version la moins compressée que nous cataloguons (Q8_0) pèse 746,32 Gio.

L’échelle ne rattrape l’écart qu’au sommet : un Mac de 64 Go, qui n’est pas une machine bon marché, reste 7 fois en dessous, 128 Go ne le ramènent qu’à 5, 192 Go qu’à 3, et la seule machine de la liste qui atteint 20 sur 20 est le Mac Studio avec M5 Ultra et 512 Go. Et le palier de 8 à 24 Go achète beaucoup plus que celui de 24 à 64 : de 6 modèles à 15, puis de 15 à 16.

Combien plus lent

La vitesse, ce sont deux nombres qui ne se comportent pas pareil, et les confondre est ce qui provoque la déception.

Écrire la réponse est limité par la bande passante mémoire. Lire votre document avant de sortir le premier mot est limité par le calcul brut. Dans une conversation courte, le second nombre ne se voit pas ; dans un document long, il n’y a que lui.

Même document de 4 000 mots en français, meilleur modèle pour les documents qui tient sur chaque machine :

Machine Modèle Écrit à Attente avant le premier mot
Portable de bureau, 16 Go, sans carte gemma4-12b ~4,1 tokens/s ~9 min
Mac avec M4 et 16 Go unifiés gemma4-12b ~9,3 tokens/s ~1 min 40 s
PC avec RTX 3060 12 Go gemma4-12b ~33 tokens/s ~29 s
PC avec RTX 4060 8 Go qwen3-8b ~35 tokens/s ~20 s
Station avec RTX 4090 24 Go qwen3.6-35b-a3b ~213 tokens/s ~2 s

Estimé par Local AI Scope, pas mesuré : la formule part de la bande passante et de la puissance déclarées par le fabricant, avec des rendements prudents. Elle est publiée pour être vérifiable, et elle ne décide jamais si un modèle tient.

Les mêmes machines avec un message normal d’environ 1 000 mots : la RTX 4060 attend environ 5 secondes et écrit à ~33 tokens/s ; le portable sans carte graphique attend environ 19 secondes et écrit à ~17 tokens/s.

La version honnête n’est donc pas « l’IA locale est lente ». Elle est : pour discuter, ça passe même sur une machine modeste, et c’est sur les documents longs que ça casse. Si votre travail, ce sont des courriels, des notes et des questions, la machine que vous avez suffit probablement. Si ce sont des contrats, des dossiers ou des rapports de vingt pages, ce qui vous fera abandonner est l’attente avant le premier mot, et cette attente ne se règle pas seulement avec plus de mémoire.

Le français coûte-t-il plus cher que l’anglais ?

Oui, et sur un type de texte il est même la langue la plus chère des quatre — ce qui n’est pas le résultat attendu.

Le contexte se réserve en tokens, et le même texte ne fait pas le même nombre de tokens selon la langue. Mesuré avec le tokenizer propre de chaque modèle sur un corpus parallèle qui nous appartient (sha256[:16] 2f6c96b6ea0b161f), voici le surcoût médian sur les 20 modèles, par type de document :

Type de texte Espagnol Français Allemand
Contrat, document juridique ×1,16 ×1,23 ×1,36
Courriel, note interne ×1,12 ×1,22 ×1,21
Ticket de support ×1,24 ×1,40 ×1,32
Code commenté ×1,20 ×1,31 ×1,46

Médianes mesurées par Local AI Scope sur 20 modèles, corpus parallèle propre. Le facteur va de ×1,36 à ×1,63 selon le modèle sur les tickets de support en français.

Sur les contrats et le code, l’allemand est plus cher. Sur les tickets de support, c’est le français. Si votre projet d’IA locale, c’est traiter des demandes clients — le cas le plus fréquent en entreprise — vous êtes sur la ligne la plus coûteuse du tableau, et c’est exactement le chiffre qu’un comparatif écrit en anglais ne vous donnera jamais.

Concrètement, ce surcoût finit par coûter un modèle. En mesurant par pas de 100 mots, sur une RTX 4060 8 Go un document français cesse de tenir là où l’anglais tenait à partir de 4 200 mots ; sur une RTX 4090, à partir de 10 200 ; sur les machines de 12 et 16 Go, à partir de 16 600. La raison est le palier : le programme réserve le contexte en puissances de deux, donc l’écart est absorbé jusqu’à ce qu’il franchisse un seuil, et là il saute d’un coup. La petite carte est celle qui le franchit le plus tôt, parce que sa marge est la plus étroite.

Une IA locale suffit-elle pour le travail de tous les jours ?

Coupons la question en deux, car les moitiés n’ont pas la même réponse.

Les travaux courts, d’une ou deux pages — rédiger, réécrire, résumer, poser des questions sur un document, travailler hors connexion : c’est la forme de tâche pour laquelle un modèle tenant sur une machine ordinaire est fait, et la confidentialité et le coût fixe sont des gains réels.

Raisonner sur un dossier entier, du code à l’échelle d’un projet, ou tout ce pour quoi vous comptiez sur un grand modèle : sauf sur un Mac Studio de 512 Go, le fichier posé sur votre disque est 3 à 87 fois plus petit que le plus gros que nous cataloguons, selon votre machine, et aucun réglage ne comble cet écart.

Ce que nous ne mesurons pas

Ce que cette différence de taille coûte en qualité de réponse, nous ne l’avons pas mesuré, et nous n’avancerons pas de chiffre.

Nous ne mesurons pas non plus la qualité de la réponse en français : cela demande d’exécuter les modèles et d’évaluer ce qu’ils répondent, il faut un GPU que nous n’avons pas, et appeler « mesure » une formule est précisément l’erreur que ce site existe pour ne pas commettre. Ce que nous mesurons, c’est le coût de la langue en tokens et ce qu’il oblige à réserver.

Si quelqu’un affirme que son modèle local « répond en français aussi bien que GPT » sans publier comment il l’a mesuré, il devine.

Si vous devez acheter, achetez de la mémoire

Deux règles tiennent dans tous les scénarios testés.

  • La mémoire décide de ce qui tient ; la bande passante décide de la vitesse. Une RTX 4070 12 Go et une RTX 3060 12 Go font tenir exactement les mêmes modèles. La 4070 les exécute plus vite et n’en ajoute aucun.
  • La spécification, c’est la taille du fichier, pas le nombre de paramètres. gemma4-12b pèse 6,63 Gio et qwen3-coder-30b 17,28 Gio : le second n’entre sur aucune machine de 12 Go, quoi que son nom laisse entendre.

Les fiches matériel donnent les deux listes de chaque machine, ce qui tient et ce qui ne tient pas, comptées comme sur cette page. Pour l’angle achat, voir quelle carte graphique pour une IA en local. Ce classement est calculé avant de regarder ce qui est en vente, comme le dit notre politique éditoriale : ici, aucune machine ne monte d’un rang parce qu’elle est plus facile à acheter.

Trois questions, et l’outil répond

Le trouveur de modèle a besoin de trois réponses et fonctionne entièrement dans votre navigateur : ce que vous y saisissez ne nous parvient pas.

  1. Quelle machine avez-vous ? Mémoire et type, pas marque. Partez de la vôtre : RTX 4060 8 Go · RTX 3060 12 Go · Mac M4 16 Go · portable sans carte graphique · RTX 4090 24 Go.
  2. Que lui donnez-vous, de quelle longueur, et dans quelle langue ? Un courriel de 600 mots et un contrat de 12 000 ne sont pas le problème de la même machine, et la langue déplace la réponse.
  3. Qu’y a-t-il dans ces données ? Rien de sensible, interne à l’entreprise, données personnelles, ou ne doit pas sortir. Seule la dernière réponse transforme le verdict en exigence plutôt qu’en préférence.

Une différence à connaître : l’outil vous montre aussi ce qui tiendrait en acceptant une compression sous Q4_K_M, et il le signale quand c’est le cas. Les comptes de cette page ne l’acceptent jamais.

Une dernière chose, parce qu’elle décide plus que le modèle : le programme qui l’exécute change ce qu’on peut charger et la télémétrie qu’il envoie. C’est dans les fiches logiciels.