Accueil›Matériel›Xiaomi AI Cube, 80 Go — prototype d’ingénierie
Xiaomi AI Cube, 80 Go — prototype d’ingénierie
mini-PC avec NPU80 GiB341 GB/s40,0 TFLOPS
Cette machine ne s’achète pas. Tout le reste de cette section est un produit en vente ; ceci est un prototype d’ingénierie, sans prix ni date. Nous le mesurons parce que les chiffres qui circulent à son sujet sont faux, et la seule façon de les corriger est de lui appliquer la même arithmétique qu’aux autres.
Cette machine laisse 77,00 Gio au modèle une fois que le système a pris sa part, et elle accepte 16 des 18 modèles que nous mesurons à la compression de référence. Ce qui décide de sa vitesse de réponse n’est pas la puce : ce sont les 341 GB/s de bande passante mémoire.
Reste pour le modèle
Estimation maison
Bande passante mémoire
Estimation maison
Modèles qui tiennent
Mesuré par Local AI Scope
La mémoire réellement utilisable
La mémoire unifiée est partagée avec le système d’exploitation et tout ce que vous avez ouvert. La réserve indiquée ici est volontairement prudente ; vous pouvez la modifier dans l’outil.
| Mémoire | Gio |
|---|---|
| Mémoire de la machine | 80 |
| Réservée au système | −3,00 |
| Reste pour le modèle | 77,00 |
Les 160 Go répétés partout ne sont pas ce que possède cette machine. C’est le maximum que la puce D100 prend en charge. L’unité montrée par Xiaomi embarque 80 Go, et c’est de 80 que sort chaque chiffre de cette page. L’écart n’a rien de cosmétique : avec 160 Go, cette machine accepterait 17 des 18 modèles au lieu de 16, et le plus gros qu’elle tiendrait serait deepseek-v4-flash à 127,28 Gio au lieu de llama4-scout-17b à 60,87 Gio.
Bande passante mémoire
Ce sont deux limites différentes, et on les confond sans cesse. Pendant que le modèle écrit sa réponse, c’est la bande passante qui commande : chaque token oblige à relire tous les poids, si bien que les tokens par seconde valent à peu près la bande passante divisée par la taille du modèle. Pendant que le modèle lit votre document, c’est le calcul qui commande : l’entrée est traitée d’un seul coup. D’où un portable sans GPU qui met des minutes avant le premier mot puis écrit à un rythme acceptable.
341 GB/s — Estimé · le fabricant ne publie ce chiffre nulle part ; le nôtre est une estimation prudente, pas une spécification.
Les 1,22 TB/s qui ont fait le tour du monde ne sont pas la bande passante mémoire de cette machine. C’est la bande passante de mémoire proche que Xiaomi attribue à l’accélérateur O100, sur de la DRAM empilée sur le die de calcul : un petit réservoir, pas les 80 Go où vit réellement un modèle de 120B. La bande passante de ces 80 Go est le chiffre que personne n’a publié ; celui de cette page est donc une hypothèse maison, étiquetée comme telle. Les 200 TOPS que l’on répète aussi sont ceux du NPU de l’O3, en entiers 8 bits : autre unité, autre puce. Nous ne les convertissons pas dans la ligne de calcul ci-dessus.
Calcul: 40,0 TFLOPS (estimation pour cette classe de machine) — Estimé · le fabricant ne publie ce chiffre nulle part ; le nôtre est une estimation prudente, pas une spécification. Les chiffres de cette ligne ne proviennent pas tous de la même mesure selon la machine, car chaque fabricant en publie une différente. Comparez-les d’une machine à l’autre en le sachant.
Quels modèles tiennent ici, et lesquels non
Tenir signifie que trois choses tiennent à la fois dans la mémoire restante : le fichier du modèle, sa mémoire de contexte et la marge de travail du runtime. La mémoire de contexte est calculée à partir du schéma d’attention que chaque modèle déclare, couche par couche, et non de la formule générique : c’est pourquoi des modèles que d’autres calculateurs jugent impossibles tiennent ici.
| Modèle | Compression affichée | Taille du modèle | 8k | 32k | 128k | Plus grand contexte qui tient |
|---|---|---|---|---|---|---|
| qwen3-1.7b | Q4_K_M |
1,03 GiB | oui | oui | — | 32k |
| qwen3-4b-2507 | Q4_K_M |
2,33 GiB | oui | oui | oui | 256k |
| gemma4-e2b | Q4_K_M |
2,89 GiB | oui | oui | oui | 128k |
| gemma4-e4b | Q4_K_M |
4,63 GiB | oui | oui | oui | 128k |
| qwen3-8b | Q4_K_M |
4,68 GiB | oui | oui | — | 32k |
| gemma4-12b | Q4_K_M |
6,63 GiB | oui | oui | oui | 256k |
| gpt-oss-20b | Q4_K_M |
10,83 GiB | oui | oui | oui | 128k |
| mistral-small-24b | Q4_K_M |
13,35 GiB | oui | oui | oui | 128k |
| qwen3.8-27b | Q4_K_M |
15,33 GiB | oui | oui | oui | 256k |
| qwen3.6-27b | Q4_K_M |
15,66 GiB | oui | oui | oui | 256k |
| gemma4-26b-a4b | Q4_K_M |
15,78 GiB | oui | oui | oui | 256k |
| gemma4-31b | Q4_K_M |
17,07 GiB | oui | oui | oui | 256k |
| qwen3-coder-30b | Q4_K_M |
17,28 GiB | oui | oui | oui | 256k |
| qwen3.6-35b-a3b | Q4_K_M |
20,61 GiB | oui | oui | oui | 256k |
| gpt-oss-120b | Q4_K_M |
58,46 GiB | oui | oui | oui | 128k |
| llama4-scout-17b | Q4_K_M |
60,87 GiB | oui | oui | non | 64k |
| deepseek-v4-flash | IQ4_XS |
127,28 GiB | non | non | non | — |
| glm-5.2 | Q4_K_M |
433,83 GiB | non | non | non | — |
Les tailles sont celles des fichiers réellement publiés à la compression de référence, un palier par ligne : Q4_K_M lorsque l’auteur la publie, le voisin le plus proche sinon. Chaque ligne indique laquelle elle affiche. Q4_K_M est notre plancher de qualité : en dessous, la perte s’entend dans les réponses. Un modèle qui ne tiendrait ici qu’avec une compression plus agressive est classé comme ne tenant pas, à dessein. Un tiret dans une colonne de contexte signifie que le modèle n’offre pas ce contexte, il n’y a donc rien à faire tenir.
Modèles qui tiennent — 16 sur les 18 modèles mesurés
- qwen3-1.7b
Q4_K_M— contexte 32k tokens - qwen3-4b-2507
Q4_K_M— contexte 256k tokens - gemma4-e2b
Q4_K_M— contexte 128k tokens - gemma4-e4b
Q4_K_M— contexte 128k tokens - qwen3-8b
Q4_K_M— contexte 32k tokens - gemma4-12b
Q4_K_M— contexte 256k tokens - gpt-oss-20b
Q4_K_M— contexte 128k tokens - mistral-small-24b
Q4_K_M— contexte 128k tokens - qwen3.8-27b
Q4_K_M— contexte 256k tokens - qwen3.6-27b
Q4_K_M— contexte 256k tokens - gemma4-26b-a4b
Q4_K_M— contexte 256k tokens - gemma4-31b
Q4_K_M— contexte 256k tokens - qwen3-coder-30b
Q4_K_M— contexte 256k tokens - qwen3.6-35b-a3b
Q4_K_M— contexte 256k tokens - gpt-oss-120b
Q4_K_M— contexte 128k tokens - llama4-scout-17b
Q4_K_M— contexte 64k tokens
Modèles qui ne tiennent pas — 2 sur les 18 modèles mesurés
- deepseek-v4-flash
IQ4_XS— il manque 51,29 GiB - glm-5.2
Q4_K_M— il manque 372,13 GiB