StartseiteRechnerXiaomi AI Cube, 80 GB — Technikprototyp

Rechner-Datenblatt

Xiaomi AI Cube, 80 GB — Technikprototyp

Mini-PC mit NPU80 GiB341 GB/s40,0 TFLOPS

Diesen Rechner kann man nicht kaufen. Alles andere in diesem Bereich ist ein verkäufliches Produkt; dies ist ein Technikprototyp ohne Preis und ohne Termin. Wir vermessen ihn, weil die kursierenden Zahlen dazu falsch sind — und der einzige Weg, sie zu berichtigen, ist dieselbe Rechnung wie bei allen anderen.

Dieser Rechner lässt dem Modell 77,00 GiB, nachdem das System seinen Anteil genommen hat, und er nimmt 16 der 18 Modelle auf, die wir bei der Referenzkompression messen. Über das Tempo der Antwort entscheidet nicht der Chip, sondern die 341 GB/s Speicherbandbreite.

Auf einen BlickRechnerdaten · 2026-08-27
Bleibt für das Modell77,00 GiB
Speicherbandbreite341 GB/s
Modelle, die passen16 / 18
Größtes Modell, das passtllama4-scout-17b
77,00 GiB

Bleibt für das Modell

Eigene Schätzung

341 GB/s

Speicherbandbreite

Eigene Schätzung

16 / 18

Modelle, die passen

Von Local AI Scope gemessen

Speicher

Der Speicher, den Sie wirklich nutzen können

Der vereinheitlichte Speicher wird mit dem Betriebssystem und allem Geöffneten geteilt. Die Reserve hier ist bewusst vorsichtig angesetzt; im Werkzeug können Sie sie ändern.

Wie aus dem Speicher auf der Verpackung nutzbarer Speicher wird
Speicher GiB
Speicher des Rechners 80
Für das System reserviert −3,00
Bleibt für das Modell 77,00

Die überall wiederholten 160 GB hat dieser Rechner nicht. Das ist das Maximum, das der Chip D100 unterstützt. Das von Xiaomi gezeigte Gerät trägt 80 GB, und aus 80 stammt jede Zahl dieser Seite. Der Unterschied ist nicht kosmetisch: Mit 160 GB nähme dieser Rechner 17 der 18 Modelle statt 16 auf, und das größte wäre deepseek-v4-flash mit 127,28 GiB statt llama4-scout-17b mit 60,87 GiB.

Tempo

Speicherbandbreite

Es sind zwei verschiedene Grenzen, und sie werden ständig verwechselt. Während das Modell die Antwort schreibt, bestimmt die Bandbreite: Für jeden einzelnen Token müssen die Gewichte erneut gelesen werden, Tokens pro Sekunde sind also ungefähr Bandbreite geteilt durch Modellgröße. Während das Modell Ihr Dokument liest, bestimmt die Rechenleistung: Die Eingabe wird auf einmal verarbeitet. Darum kann ein Notebook ohne GPU Minuten bis zum ersten Wort brauchen und danach in erträglichem Tempo schreiben.

341 GB/sGeschätzt · der Hersteller veröffentlicht diese Zahl überhaupt nicht; unsere ist eine vorsichtige Schätzung, keine Spezifikation.

Die 1,22 TB/s, die um die Welt gingen, sind nicht die Speicherbandbreite dieses Rechners. Es ist die Nahspeicher-Bandbreite, die Xiaomi dem Beschleuniger O100 zuschreibt, über DRAM, das auf dem Rechen-Die gestapelt ist: ein kleiner Pool, nicht die 80 GB, in denen ein 120B-Modell tatsächlich liegt. Die Bandbreite dieser 80 GB hat niemand veröffentlicht; die Zahl auf dieser Seite ist daher unsere eigene Annahme und ist so gekennzeichnet. Die ebenfalls wiederholten 200 TOPS gehören zur NPU des O3 und sind 8-Bit-Ganzzahlen: andere Einheit, anderer Chip. Wir rechnen sie nicht in die Rechenzeile oben um.

Rechenleistung: 40,0 TFLOPS (Schätzung für diese Geräteklasse) — Geschätzt · der Hersteller veröffentlicht diese Zahl überhaupt nicht; unsere ist eine vorsichtige Schätzung, keine Spezifikation. Die Zahlen dieser Zeile stammen je nach Rechner nicht aus derselben Messgröße, weil jeder Hersteller eine andere veröffentlicht. Vergleichen Sie sie zwischen Rechnern nur mit diesem Wissen.

Passung

Welche Modelle hier hineinpassen und welche nicht

Passen heißt, dass drei Dinge gleichzeitig in den übrigen Speicher passen: die Modelldatei, ihr Kontextspeicher und die Arbeitsreserve der Laufzeitumgebung. Der Kontextspeicher wird aus dem von jedem Modell angegebenen Aufmerksamkeitsmuster Schicht für Schicht berechnet, nicht aus der generischen Formel — deshalb passen hier Modelle, die andere Rechner für unmöglich erklären.

Jedes gemessene Modell gegen diesen Rechner: Größe, ob es bei jedem Kontext passt, und der größte Kontext, den es hält
Modell Gezeigte Kompression Modellgröße 8k 32k 128k Größter Kontext, der passt
qwen3-1.7b Q4_K_M 1,03 GiB ja ja 32k
qwen3-4b-2507 Q4_K_M 2,33 GiB ja ja ja 256k
gemma4-e2b Q4_K_M 2,89 GiB ja ja ja 128k
gemma4-e4b Q4_K_M 4,63 GiB ja ja ja 128k
qwen3-8b Q4_K_M 4,68 GiB ja ja 32k
gemma4-12b Q4_K_M 6,63 GiB ja ja ja 256k
gpt-oss-20b Q4_K_M 10,83 GiB ja ja ja 128k
mistral-small-24b Q4_K_M 13,35 GiB ja ja ja 128k
qwen3.8-27b Q4_K_M 15,33 GiB ja ja ja 256k
qwen3.6-27b Q4_K_M 15,66 GiB ja ja ja 256k
gemma4-26b-a4b Q4_K_M 15,78 GiB ja ja ja 256k
gemma4-31b Q4_K_M 17,07 GiB ja ja ja 256k
qwen3-coder-30b Q4_K_M 17,28 GiB ja ja ja 256k
qwen3.6-35b-a3b Q4_K_M 20,61 GiB ja ja ja 256k
gpt-oss-120b Q4_K_M 58,46 GiB ja ja ja 128k
llama4-scout-17b Q4_K_M 60,87 GiB ja ja nein 64k
deepseek-v4-flash IQ4_XS 127,28 GiB nein nein nein
glm-5.2 Q4_K_M 433,83 GiB nein nein nein

Die Größen sind die der tatsächlich veröffentlichten Dateien in der Referenzkompression, eine Stufe je Zeile: Q4_K_M, wo der Autor sie veröffentlicht, sonst die nächstgelegene. Jede Zeile nennt, welche sie zeigt. Q4_K_M ist unsere Qualitätsuntergrenze: darunter ist der Verlust in den Antworten hörbar. Ein Modell, das hier nur mit stärkerer Kompression passen würde, gilt bewusst als nicht passend. Ein Gedankenstrich in einer Kontextspalte heißt, dass das Modell diesen Kontext gar nicht anbietet, es gibt also nichts einzupassen.

Modelle, die passen — 16 von den 18 gemessenen Modellen

Modelle, die nicht passen — 2 von den 18 gemessenen Modellen