Inicio›Modelos›qwen3.8-flash-next

Ficha de modelo

qwen3.8-flash-next

Arquitectura mezcla de expertos48 CapasLicencia qwen-community-1.0Contexto máximo 256kVocabulario 248.320

En IQ4_XS es un fichero de 87,25 GiB y entra en 4 de los 18 equipos que medimos. Aquí lo que llena la memoria es el fichero: incluso con su contexto máximo de 256k tokens, el contexto suma 6,00 GiB — y el mismo contenido, en tokens, cuesta en español ×1,18 lo que en inglés (en alemán, ×1,31).

De un vistazo
Tamaño en IQ4_XS87,25 GiB
Memoria de contexto a 8k0,19 GiB
Cabe en4 / 18
Coste del alemán×1,31
Equipo más pequeño que lo admitePC con Ryzen AI Max+ 395 y 128 GB unificados
87,25 GiB

Tamaño del modelo en IQ4_XS

Medido por Local AI Scope

0,19 GiB

Memoria de contexto a 8k tokens

Medido por Local AI Scope

×1,31

Lo que cuesta el alemán frente al inglés

Medido por Local AI Scope

Tamaños

Tamaños de los ficheros publicados

Son los tamaños de los ficheros que publica su autor, sumados cuando el modelo viene partido en trozos. No es una estimación a partir del número de parámetros.

Tamaño del fichero publicado para cada compresión
Compresión Tamaño del modelo
Q8_0 175,30 GiB
IQ4_XS 87,25 GiB

Este modelo también lee imágenes. Para eso necesita un segundo fichero, el proyector de visión (mmproj-F16.gguf, 0,84 GiB), que se publica junto al modelo y no está sumado en las cifras de esta página: cuentan solo el texto. Si vas a pasarle imágenes, añádelo al tamaño del modelo.

Contexto

Memoria de contexto

Calculada con el patrón de atención que este modelo declara capa a capa, no con la fórmula genérica. Por eso la cifra suele ser bastante menor que la que dan otras calculadoras. Además de esa memoria, este modelo guarda una segunda caché, más pequeña, para el indexador de su atención dispersa: unos 3 KiB por token, 0,02 GiB a 8k y 0,75 GiB con su contexto máximo. Está derivada del código y de la cabecera del fichero, no la declara el autor, y no está sumada en las cifras de esta página. Sumada, no cambia ningún veredicto de la tabla de equipos.

  • 8k tokens → 0,19 GiB
  • 32k tokens → 0,75 GiB
  • 128k tokens → 3,00 GiB
Idiomas

Lo que cuesta en cada idioma

Medido ejecutando el tokenizador de este modelo sobre el mismo contenido en cuatro idiomas. Los tokens son lo que se paga en contexto, en memoria y en la factura de la nube.

Coste en tokens por tipo de texto y por idioma, con el inglés de referencia
Tipo de texto EN ES FR DE
Código — ×1,20 ×1,30 ×1,46
Contratos — ×1,16 ×1,23 ×1,31
Correo de empresa — ×1,12 ×1,22 ×1,17
Tickets de soporte — ×1,24 ×1,40 ×1,25

El inglés es la referencia: cada cifra es cuántas veces más tokens cuesta el mismo contenido en ese idioma. Media sobre todo el corpus: DE ×1,31.

Equipos

Dónde cabe

Que quepa significa que caben el modelo, su memoria de contexto y el margen de trabajo al contexto indicado, dejándole al sistema lo suyo. 4 de los 18 equipos probados (IQ4_XS, 8k tokens).

Los 18 equipos probados, con la memoria que deja cada uno y el mayor contexto que este modelo aguanta en él
Equipo Cabe Memoria libre Mayor contexto que cabe
PC con RTX 4060 8 GB no 7,20 GiB —
PC con RTX 3060 12 GB no 11,20 GiB —
PC con RTX 4070 12 GB no 11,20 GiB —
Mac con M4 y 16 GB unificados no 13,00 GiB —
Portátil de oficina, solo CPU y 16 GB no 13,00 GiB —
Mac mini con M6 y 16 GB unificados no 13,00 GiB —
Mac con M4 Pro y 24 GB no 21,00 GiB —
Estación con RTX 4090 24 GB no 23,20 GiB —
Mini-PC con NPU y 32 GB LPDDR5X no 29,00 GiB —
Mac mini con M6 y 32 GB unificados no 29,00 GiB —
Servidor con 2× RTX 3090 (48 GB) no 47,20 GiB —
Mac con M4 Max y 64 GB no 61,00 GiB —
Mac mini con M5 Pro y 64 GB unificados no 61,00 GiB —
Xiaomi AI Cube, 80 GB — prototipo de ingeniería no 77,00 GiB —
PC con Ryzen AI Max+ 395 y 128 GB unificados sí 96,00 GiB 128k
Mac Studio con M5 Max y 128 GB unificados sí 125,00 GiB 256k
PC con Ryzen AI Max+ PRO 495 y 192 GB unificados sí 160,00 GiB 256k
Mac Studio con M5 Ultra y 512 GB unificados sí 509,00 GiB 256k

Una pieza de este modelo se comporta distinto según el programa que lo ejecute. 26,82 GiB del fichero IQ4_XS son una tabla de n-gramas (per_layer_token_embd) de la que solo se leen unas pocas filas cada vez. llama.cpp v0.5.0 y posteriores la dejan en el disco por defecto y leen esas filas cuando hacen falta, así que lo que tiene que caber en memoria baja a 60,43 GiB. Con esa cuenta cabría también en Xiaomi AI Cube, 80 GB — prototipo de ingeniería, hasta 256k tokens de contexto. Lo más cerca de caber: Mac con M4 Max y 64 GB · Mac mini con M5 Pro y 64 GB unificados, a 0,20 GiB. La tabla de arriba cuenta el fichero entero, porque eso vale para cualquier programa; el ahorro solo está comprobado para llama.cpp v0.5.0, en su código y en la cabecera del fichero. Ese mismo código marca su soporte de esta arquitectura como provisional, pendiente de reescribirse entero (leído el 29 de septiembre de 2026).