granite-4.2-8b
Arquitectura denso40 CapasLicencia apache-2.0Contexto máximo 128kVocabulario 100.352
En Q4_K_M es un fichero de 4,98 GiB y entra en 18 de los 18 equipos que medimos. Lo que cuesta ejecutarlo no es el fichero: es el contexto — y el mismo contenido, en tokens, cuesta en español ×1,31 lo que en inglés (en alemán, ×1,61).
Tamaño del modelo en Q4_K_M
Medido por Local AI Scope
Memoria de contexto a 8k tokens
Medido por Local AI Scope
Lo que cuesta el alemán frente al inglés
Medido por Local AI Scope
Tamaños de los ficheros publicados
Son los tamaños de los ficheros que publica su autor, sumados cuando el modelo viene partido en trozos. No es una estimación a partir del número de parámetros.
| Compresión | Tamaño del modelo |
|---|---|
Q8_0 |
8,70 GiB |
Q6_K |
6,72 GiB |
Q5_K_M |
5,82 GiB |
Q5_K_S |
5,68 GiB |
Q4_K_M |
4,98 GiB |
Q4_K_S |
4,74 GiB |
Q3_K_M |
4,05 GiB |
Memoria de contexto
Calculada con el patrón de atención que este modelo declara capa a capa, no con la fórmula genérica. Por eso la cifra suele ser bastante menor que la que dan otras calculadoras. El config.json de este modelo no dice cuánto mide cada cabeza de atención, y ese número es de lo que está hecha la memoria de contexto. Lo derivamos de dos cifras que sí declara, 4.096 unidades ocultas entre 32 cabezas de atención, que es lo que significa el tamaño de una cabeza y lo que la biblioteca de referencia da por supuesto: 128. Todas las cifras de esta sección se apoyan en esa derivación, así que se etiqueta aquí en vez de darse por sabida.
- 8k tokens → 1,25 GiB
- 32k tokens → 5,00 GiB
- 128k tokens → 20,00 GiB
Lo que cuesta en cada idioma
Medido ejecutando el tokenizador de este modelo sobre el mismo contenido en cuatro idiomas. Los tokens son lo que se paga en contexto, en memoria y en la factura de la nube.
| Tipo de texto | EN | ES | FR | DE |
|---|---|---|---|---|
| Código | — | ×1,22 | ×1,42 | ×1,60 |
| Contratos | — | ×1,39 | ×1,47 | ×1,76 |
| Correo de empresa | — | ×1,27 | ×1,41 | ×1,48 |
| Tickets de soporte | — | ×1,39 | ×1,63 | ×1,55 |
El inglés es la referencia: cada cifra es cuántas veces más tokens cuesta el mismo contenido en ese idioma. Media sobre todo el corpus: DE ×1,61.
Dónde cabe
Que quepa significa que caben el modelo, su memoria de contexto y el margen de trabajo al contexto indicado, dejándole al sistema lo suyo. 18 de los 18 equipos probados (Q4_K_M, 8k tokens).
