InicioEquiposXiaomi AI Cube, 80 GB — prototipo de ingeniería

Ficha de equipo

Xiaomi AI Cube, 80 GB — prototipo de ingeniería

mini-PC con NPU80 GiB341 GB/s40,0 TFLOPS

Esta máquina no se puede comprar. Todo lo demás de esta sección es un producto a la venta; esto es un prototipo de ingeniería sin precio y sin fecha. Se mide aquí porque las cifras que circulan sobre él están mal, y la única forma de corregirlas es pasarlo por la misma aritmética que a los demás.

Este equipo deja 77,00 GiB para el modelo una vez el sistema coge lo suyo, y admite 16 de los 18 modelos que medimos en la compresión de referencia. Lo que decide su velocidad de respuesta no es el chip: son los 341 GB/s de ancho de banda de memoria.

De un vistazoDato de equipos · 2026-08-27
Queda para el modelo77,00 GiB
Ancho de banda341 GB/s
Modelos que caben16 / 18
Mayor modelo que admitellama4-scout-17b
77,00 GiB

Queda para el modelo

Estimación propia

341 GB/s

Ancho de banda de memoria

Estimación propia

16 / 18

Modelos que caben

Medido por Local AI Scope

Memoria

La memoria que de verdad puedes usar

La memoria unificada la comparte el sistema operativo con todo lo que tengas abierto. La reserva de aquí es deliberadamente conservadora; puedes cambiarla en la herramienta.

Cómo la memoria de la caja se convierte en memoria que puedes usar
Memoria GiB
Memoria del equipo 80
Reservada al sistema −3,00
Queda para el modelo 77,00

Los 160 GB que se repiten en todas partes no son lo que tiene esta máquina. Son el máximo que admite el chip D100. La unidad que enseñó Xiaomi lleva 80 GB, y de 80 sale cada cifra de esta página. La diferencia no es cosmética: con 160 GB esta máquina admitiría 17 de los 18 modelos en vez de 16, y el mayor que aguanta sería deepseek-v4-flash con 127,28 GiB en vez de llama4-scout-17b con 60,87 GiB.

Velocidad

Ancho de banda de memoria

Son dos límites distintos y se confunden constantemente. Mientras el modelo escribe la respuesta manda el ancho de banda: cada token obliga a releer los pesos enteros, así que los tokens por segundo son aproximadamente el ancho de banda dividido entre el tamaño del modelo. Mientras el modelo lee tu documento manda el cómputo: la entrada se procesa de una vez. Por eso un portátil sin GPU puede tardar minutos en soltar la primera palabra y luego escribir a un ritmo tolerable.

341 GB/sEstimado · el fabricante no publica esta cifra en ninguna parte; la nuestra es una estimación conservadora, no una especificación.

Los 1,22 TB/s que ha dado la vuelta al mundo no son el ancho de banda de memoria de esta máquina. Son el ancho de banda de memoria cercana que Xiaomi atribuye al acelerador O100, sobre DRAM apilada encima del die de cómputo: un pozo pequeño, no los 80 GB donde de verdad vive un modelo de 120B. El ancho de banda de esos 80 GB es la cifra que nadie ha publicado, así que la de esta página es un supuesto nuestro y va etiquetada como tal. Los 200 TOPS que también se repiten son de la NPU del O3 y son enteros de 8 bits: otra unidad y otro chip. No se convierten a la línea de cómputo de arriba.

Cómputo: 40,0 TFLOPS (estimación para esta clase de equipo) — Estimado · el fabricante no publica esta cifra en ninguna parte; la nuestra es una estimación conservadora, no una especificación. Las cifras de esta línea no salen todas de la misma medida según el equipo, porque cada fabricante publica una distinta. Compáralas entre equipos sabiendo eso.

Encaje

Qué modelos entran aquí y cuáles no

Que quepa significa que caben tres cosas a la vez en la memoria que sobra: el fichero del modelo, su memoria de contexto y el margen de trabajo del runtime. La memoria de contexto se calcula con el patrón de atención que cada modelo declara capa a capa, no con la fórmula genérica: por eso aquí caben modelos que otras calculadoras dan por imposibles.

Cada modelo medido frente a este equipo: tamaño, si cabe en cada contexto y el mayor contexto que aguanta
Modelo Compresión mostrada Tamaño del modelo 8k 32k 128k Mayor contexto que cabe
qwen3-1.7b Q4_K_M 1,03 GiB 32k
qwen3-4b-2507 Q4_K_M 2,33 GiB 256k
gemma4-e2b Q4_K_M 2,89 GiB 128k
gemma4-e4b Q4_K_M 4,63 GiB 128k
qwen3-8b Q4_K_M 4,68 GiB 32k
gemma4-12b Q4_K_M 6,63 GiB 256k
gpt-oss-20b Q4_K_M 10,83 GiB 128k
mistral-small-24b Q4_K_M 13,35 GiB 128k
qwen3.8-27b Q4_K_M 15,33 GiB 256k
qwen3.6-27b Q4_K_M 15,66 GiB 256k
gemma4-26b-a4b Q4_K_M 15,78 GiB 256k
gemma4-31b Q4_K_M 17,07 GiB 256k
qwen3-coder-30b Q4_K_M 17,28 GiB 256k
qwen3.6-35b-a3b Q4_K_M 20,61 GiB 256k
gpt-oss-120b Q4_K_M 58,46 GiB 128k
llama4-scout-17b Q4_K_M 60,87 GiB no 64k
deepseek-v4-flash IQ4_XS 127,28 GiB no no no
glm-5.2 Q4_K_M 433,83 GiB no no no

Los tamaños son los de los ficheros realmente publicados en la compresión de referencia, un escalón por fila: Q4_K_M donde el autor la publica y el vecino más cercano donde no. Cada fila dice cuál está enseñando. Q4_K_M es nuestro suelo de calidad: por debajo la pérdida se nota en las respuestas. Un modelo que solo cabría aquí con una compresión más agresiva figura como que no cabe, a propósito. Un guion en una columna de contexto significa que el modelo no ofrece ese contexto, así que no hay nada que encajar.

Modelos que caben — 16 de los 18 modelos medidos

Modelos que no caben — 2 de los 18 modelos medidos