Inicio›Modelos›llama4-scout-17b
llama4-scout-17b
Arquitectura mezcla de expertos48 CapasLicencia otherContexto máximo 10.240kVocabulario 202.048
En Q4_K_M es un fichero de 60,87 GiB y no entra en ninguno de los 10 equipos que medimos a 8k tokens. El fichero no es lo que llena la memoria: es el contexto.
Tamaño del modelo en Q4_K_M
Medido por Local AI Scope
Memoria de contexto a 8k tokens
Medido por Local AI Scope
Lo que cuesta el alemán frente al inglés
Medido por Local AI Scope
Tamaños de los ficheros publicados
Son los tamaños de los ficheros que publica su autor, sumados cuando el modelo viene partido en trozos. No es una estimación a partir del número de parámetros.
| Compresión | Tamaño del modelo |
|---|---|
Q8_0 |
106,67 GiB |
Q6_K |
82,36 GiB |
Q5_K_M |
71,29 GiB |
Q5_K_S |
69,16 GiB |
Q4_K_M |
60,87 GiB |
Q4_K_S |
57,23 GiB |
IQ4_XS |
53,69 GiB |
Q3_K_M |
48,20 GiB |
Memoria de contexto
Calculada con el patrón de atención que este modelo declara capa a capa, no con la fórmula genérica. Por eso la cifra suele ser bastante menor que la que dan otras calculadoras.
- 8k tokens → 1,50 GiB
- 32k tokens → 6,00 GiB
- 128k tokens → 24,00 GiB
Lo que cuesta en cada idioma
Medido ejecutando el tokenizador de este modelo sobre el mismo contenido en cuatro idiomas. Los tokens son lo que se paga en contexto, en memoria y en la factura de la nube.
| Tipo de texto | EN | ES | FR | DE |
|---|---|---|---|---|
| Código | — | ×1,19 | ×1,32 | ×1,40 |
| Contratos | — | ×1,13 | ×1,23 | ×1,26 |
| Correo de empresa | — | ×1,13 | ×1,21 | ×1,23 |
| Tickets de soporte | — | ×1,21 | ×1,37 | ×1,26 |
El inglés es la referencia: cada cifra es cuántas veces más tokens cuesta el mismo contenido en ese idioma. Media sobre todo el corpus: DE ×1,30.
Dónde cabe
Que quepa significa que caben el modelo, su memoria de contexto y el margen de trabajo al contexto indicado, dejándole al sistema lo suyo. 0 de los 10 equipos probados (Q4_K_M, 8k tokens).
| Equipo | Cabe | Memoria libre | Mayor contexto que cabe |
|---|---|---|---|
| PC con RTX 4060 8 GB | no | 7,20 GiB | — |
| PC con RTX 3060 12 GB | no | 11,20 GiB | — |
| PC con RTX 4070 12 GB | no | 11,20 GiB | — |
| Mac con M4 y 16 GB unificados | no | 13,00 GiB | — |
| Portátil de oficina, solo CPU y 16 GB | no | 13,00 GiB | — |
| Mac con M4 Pro y 24 GB | no | 21,00 GiB | — |
| Estación con RTX 4090 24 GB | no | 23,20 GiB | — |
| Mini-PC con NPU y 32 GB LPDDR5X | no | 29,00 GiB | — |
| Servidor con 2× RTX 3090 (48 GB) | no | 47,20 GiB | — |
| Mac con M4 Max y 64 GB | no | 61,00 GiB | — |
Ninguno de los equipos que medimos admite este modelo en la compresión de referencia, ni siquiera con el contexto más bajo.