Inicio›Modelos›qwen3.8-flash-next
qwen3.8-flash-next
Arquitectura mezcla de expertos48 CapasLicencia qwen-community-1.0Contexto máximo 256kVocabulario 248.320
En IQ4_XS es un fichero de 87,25 GiB y entra en 4 de los 18 equipos que medimos. Aquí lo que llena la memoria es el fichero: incluso con su contexto máximo de 256k tokens, el contexto suma 6,00 GiB — y el mismo contenido, en tokens, cuesta en español ×1,18 lo que en inglés (en alemán, ×1,31).
Tamaño del modelo en IQ4_XS
Medido por Local AI Scope
Memoria de contexto a 8k tokens
Medido por Local AI Scope
Lo que cuesta el alemán frente al inglés
Medido por Local AI Scope
Tamaños de los ficheros publicados
Son los tamaños de los ficheros que publica su autor, sumados cuando el modelo viene partido en trozos. No es una estimación a partir del número de parámetros.
| Compresión | Tamaño del modelo |
|---|---|
Q8_0 |
175,30 GiB |
IQ4_XS |
87,25 GiB |
Este modelo también lee imágenes. Para eso necesita un segundo fichero, el proyector de visión (mmproj-F16.gguf, 0,84 GiB), que se publica junto al modelo y no está sumado en las cifras de esta página: cuentan solo el texto. Si vas a pasarle imágenes, añádelo al tamaño del modelo.
Memoria de contexto
Calculada con el patrón de atención que este modelo declara capa a capa, no con la fórmula genérica. Por eso la cifra suele ser bastante menor que la que dan otras calculadoras. Además de esa memoria, este modelo guarda una segunda caché, más pequeña, para el indexador de su atención dispersa: unos 3 KiB por token, 0,02 GiB a 8k y 0,75 GiB con su contexto máximo. Está derivada del código y de la cabecera del fichero, no la declara el autor, y no está sumada en las cifras de esta página. Sumada, no cambia ningún veredicto de la tabla de equipos.
- 8k tokens → 0,19 GiB
- 32k tokens → 0,75 GiB
- 128k tokens → 3,00 GiB
Lo que cuesta en cada idioma
Medido ejecutando el tokenizador de este modelo sobre el mismo contenido en cuatro idiomas. Los tokens son lo que se paga en contexto, en memoria y en la factura de la nube.
| Tipo de texto | EN | ES | FR | DE |
|---|---|---|---|---|
| Código | — | ×1,20 | ×1,30 | ×1,46 |
| Contratos | — | ×1,16 | ×1,23 | ×1,31 |
| Correo de empresa | — | ×1,12 | ×1,22 | ×1,17 |
| Tickets de soporte | — | ×1,24 | ×1,40 | ×1,25 |
El inglés es la referencia: cada cifra es cuántas veces más tokens cuesta el mismo contenido en ese idioma. Media sobre todo el corpus: DE ×1,31.
Dónde cabe
Que quepa significa que caben el modelo, su memoria de contexto y el margen de trabajo al contexto indicado, dejándole al sistema lo suyo. 4 de los 18 equipos probados (IQ4_XS, 8k tokens).
Una pieza de este modelo se comporta distinto según el programa que lo ejecute. 26,82 GiB del fichero IQ4_XS son una tabla de n-gramas (per_layer_token_embd) de la que solo se leen unas pocas filas cada vez. llama.cpp v0.5.0 y posteriores la dejan en el disco por defecto y leen esas filas cuando hacen falta, así que lo que tiene que caber en memoria baja a 60,43 GiB. Con esa cuenta cabría también en Xiaomi AI Cube, 80 GB — prototipo de ingeniería, hasta 256k tokens de contexto. Lo más cerca de caber: Mac con M4 Max y 64 GB · Mac mini con M5 Pro y 64 GB unificados, a 0,20 GiB. La tabla de arriba cuenta el fichero entero, porque eso vale para cualquier programa; el ahorro solo está comprobado para llama.cpp v0.5.0, en su código y en la cabecera del fichero. Ese mismo código marca su soporte de esta arquitectura como provisional, pendiente de reescribirse entero (leído el 29 de septiembre de 2026).
