Accueil›Matériel›Serveur avec 2× RTX 3090 (48 Go)
Serveur avec 2× RTX 3090 (48 Go)
Carte graphique NVIDIA48 GiB936 GB/s71,0 TFLOPS
Cette machine laisse 47,20 Gio au modèle une fois que le système a pris sa part, et elle accepte 14 des 18 modèles que nous mesurons à la compression de référence. Ce qui décide de sa vitesse de réponse n’est pas la puce : ce sont les 936 GB/s de bande passante mémoire.
Reste pour le modèle
Estimation maison
Bande passante mémoire
Déclaré par le fabricant
Modèles qui tiennent
Mesuré par Local AI Scope
La mémoire réellement utilisable
C’est pour cela que le chiffre de la boîte n’est pas celui dont vous disposez. Le bureau, le compositeur et le contexte graphique ne rendent jamais leur part, et un modèle qui ne leur laisse pas de place ne démarre pas : il plante.
| Mémoire | Gio |
|---|---|
| Mémoire de la machine | 48 |
| Réservée au système | −0,80 |
| Reste pour le modèle | 47,20 |
Ces 48 Go sont deux réservoirs distincts de 24 Go, pas un seul. Ils ne s’additionnent que si le runtime répartit le modèle entre les deux cartes par couches ; un modèle qui doit tenir sur une seule carte reste plafonné à 24 Go. Les calculs ci-dessous supposent que la répartition fonctionne.
Bande passante mémoire
Ce sont deux limites différentes, et on les confond sans cesse. Pendant que le modèle écrit sa réponse, c’est la bande passante qui commande : chaque token oblige à relire tous les poids, si bien que les tokens par seconde valent à peu près la bande passante divisée par la taille du modèle. Pendant que le modèle lit votre document, c’est le calcul qui commande : l’entrée est traitée d’un seul coup. D’où un portable sans GPU qui met des minutes avant le premier mot puis écrit à un rythme acceptable.
936 GB/s — Déclaré par le fabricant · vérifié sur la page du fabricant le 2026-08-25 (Source).
Les 936 GB/s sont par carte. Deux 3090 ne forment pas un pool de 48 Go à 1872 GB/s : chacune a ses 24 Go, et lorsque le modèle est réparti entre les deux, le goulet est le lien entre elles, pas la bande passante de l’une d’elles.
Calcul: 71,0 TFLOPS (TFLOPS FP16 sur Tensor Cores avec accumulation FP32, dense) — Déclaré par le fabricant, sous un autre nom · le fabricant publie ce nombre en tant que TFLOPS FP16 sur Tensor Cores avec accumulation FP32, dense, et non en FP16; vérifié sur la page du fabricant le 2026-08-25 (Source). Les chiffres de cette ligne ne proviennent pas tous de la même mesure selon la machine, car chaque fabricant en publie une différente. Comparez-les d’une machine à l’autre en le sachant.
Quels modèles tiennent ici, et lesquels non
Tenir signifie que trois choses tiennent à la fois dans la mémoire restante : le fichier du modèle, sa mémoire de contexte et la marge de travail du runtime. La mémoire de contexte est calculée à partir du schéma d’attention que chaque modèle déclare, couche par couche, et non de la formule générique : c’est pourquoi des modèles que d’autres calculateurs jugent impossibles tiennent ici.
| Modèle | Compression affichée | Taille du modèle | 8k | 32k | 128k | Plus grand contexte qui tient |
|---|---|---|---|---|---|---|
| qwen3-1.7b | Q4_K_M |
1,03 GiB | oui | oui | — | 32k |
| qwen3-4b-2507 | Q4_K_M |
2,33 GiB | oui | oui | oui | 256k |
| gemma4-e2b | Q4_K_M |
2,89 GiB | oui | oui | oui | 128k |
| gemma4-e4b | Q4_K_M |
4,63 GiB | oui | oui | oui | 128k |
| qwen3-8b | Q4_K_M |
4,68 GiB | oui | oui | — | 32k |
| gemma4-12b | Q4_K_M |
6,63 GiB | oui | oui | oui | 256k |
| gpt-oss-20b | Q4_K_M |
10,83 GiB | oui | oui | oui | 128k |
| mistral-small-24b | Q4_K_M |
13,35 GiB | oui | oui | oui | 128k |
| qwen3.8-27b | Q4_K_M |
15,33 GiB | oui | oui | oui | 256k |
| qwen3.6-27b | Q4_K_M |
15,66 GiB | oui | oui | oui | 256k |
| gemma4-26b-a4b | Q4_K_M |
15,78 GiB | oui | oui | oui | 256k |
| gemma4-31b | Q4_K_M |
17,07 GiB | oui | oui | oui | 128k |
| qwen3-coder-30b | Q4_K_M |
17,28 GiB | oui | oui | oui | 256k |
| qwen3.6-35b-a3b | Q4_K_M |
20,61 GiB | oui | oui | oui | 256k |
| gpt-oss-120b | Q4_K_M |
58,46 GiB | non | non | non | — |
| llama4-scout-17b | Q4_K_M |
60,87 GiB | non | non | non | — |
| deepseek-v4-flash | IQ4_XS |
127,28 GiB | non | non | non | — |
| glm-5.2 | Q4_K_M |
433,83 GiB | non | non | non | — |
Les tailles sont celles des fichiers réellement publiés à la compression de référence, un palier par ligne : Q4_K_M lorsque l’auteur la publie, le voisin le plus proche sinon. Chaque ligne indique laquelle elle affiche. Q4_K_M est notre plancher de qualité : en dessous, la perte s’entend dans les réponses. Un modèle qui ne tiendrait ici qu’avec une compression plus agressive est classé comme ne tenant pas, à dessein. Un tiret dans une colonne de contexte signifie que le modèle n’offre pas ce contexte, il n’y a donc rien à faire tenir.
Modèles qui tiennent — 14 sur les 18 modèles mesurés
- qwen3-1.7b
Q4_K_M— contexte 32k tokens - qwen3-4b-2507
Q4_K_M— contexte 256k tokens - gemma4-e2b
Q4_K_M— contexte 128k tokens - gemma4-e4b
Q4_K_M— contexte 128k tokens - qwen3-8b
Q4_K_M— contexte 32k tokens - gemma4-12b
Q4_K_M— contexte 256k tokens - gpt-oss-20b
Q4_K_M— contexte 128k tokens - mistral-small-24b
Q4_K_M— contexte 128k tokens - qwen3.8-27b
Q4_K_M— contexte 256k tokens - qwen3.6-27b
Q4_K_M— contexte 256k tokens - gemma4-26b-a4b
Q4_K_M— contexte 256k tokens - gemma4-31b
Q4_K_M— contexte 128k tokens - qwen3-coder-30b
Q4_K_M— contexte 256k tokens - qwen3.6-35b-a3b
Q4_K_M— contexte 256k tokens
Modèles qui ne tiennent pas — 4 sur les 18 modèles mesurés
- gpt-oss-120b
Q4_K_M— il manque 12,08 GiB - llama4-scout-17b
Q4_K_M— il manque 15,10 GiB - deepseek-v4-flash
IQ4_XS— il manque 81,09 GiB - glm-5.2
Q4_K_M— il manque 401,93 GiB