Inicio›Modelos›granite-4.2-8b

Ficha de modelo

granite-4.2-8b

Arquitectura denso40 CapasLicencia apache-2.0Contexto máximo 128kVocabulario 100.352

En Q4_K_M es un fichero de 4,98 GiB y entra en 18 de los 18 equipos que medimos. Lo que cuesta ejecutarlo no es el fichero: es el contexto — y el mismo contenido, en tokens, cuesta en español ×1,31 lo que en inglés (en alemán, ×1,61).

De un vistazo
Tamaño en Q4_K_M4,98 GiB
Memoria de contexto a 8k1,25 GiB
Cabe en18 / 18
Coste del alemán×1,61
Equipo más pequeño que lo admitePC con RTX 4060 8 GB
4,98 GiB

Tamaño del modelo en Q4_K_M

Medido por Local AI Scope

1,25 GiB

Memoria de contexto a 8k tokens

Medido por Local AI Scope

×1,61

Lo que cuesta el alemán frente al inglés

Medido por Local AI Scope

Tamaños

Tamaños de los ficheros publicados

Son los tamaños de los ficheros que publica su autor, sumados cuando el modelo viene partido en trozos. No es una estimación a partir del número de parámetros.

Tamaño del fichero publicado para cada compresión
Compresión Tamaño del modelo
Q8_0 8,70 GiB
Q6_K 6,72 GiB
Q5_K_M 5,82 GiB
Q5_K_S 5,68 GiB
Q4_K_M 4,98 GiB
Q4_K_S 4,74 GiB
Q3_K_M 4,05 GiB
Contexto

Memoria de contexto

Calculada con el patrón de atención que este modelo declara capa a capa, no con la fórmula genérica. Por eso la cifra suele ser bastante menor que la que dan otras calculadoras. El config.json de este modelo no dice cuánto mide cada cabeza de atención, y ese número es de lo que está hecha la memoria de contexto. Lo derivamos de dos cifras que sí declara, 4.096 unidades ocultas entre 32 cabezas de atención, que es lo que significa el tamaño de una cabeza y lo que la biblioteca de referencia da por supuesto: 128. Todas las cifras de esta sección se apoyan en esa derivación, así que se etiqueta aquí en vez de darse por sabida.

  • 8k tokens → 1,25 GiB
  • 32k tokens → 5,00 GiB
  • 128k tokens → 20,00 GiB
Idiomas

Lo que cuesta en cada idioma

Medido ejecutando el tokenizador de este modelo sobre el mismo contenido en cuatro idiomas. Los tokens son lo que se paga en contexto, en memoria y en la factura de la nube.

Coste en tokens por tipo de texto y por idioma, con el inglés de referencia
Tipo de texto EN ES FR DE
Código — ×1,22 ×1,42 ×1,60
Contratos — ×1,39 ×1,47 ×1,76
Correo de empresa — ×1,27 ×1,41 ×1,48
Tickets de soporte — ×1,39 ×1,63 ×1,55

El inglés es la referencia: cada cifra es cuántas veces más tokens cuesta el mismo contenido en ese idioma. Media sobre todo el corpus: DE ×1,61.

Equipos

Dónde cabe

Que quepa significa que caben el modelo, su memoria de contexto y el margen de trabajo al contexto indicado, dejándole al sistema lo suyo. 18 de los 18 equipos probados (Q4_K_M, 8k tokens).

Los 18 equipos probados, con la memoria que deja cada uno y el mayor contexto que este modelo aguanta en él
Equipo Cabe Memoria libre Mayor contexto que cabe
PC con RTX 4060 8 GB sí 7,20 GiB 8k
PC con RTX 3060 12 GB sí 11,20 GiB 32k
PC con RTX 4070 12 GB sí 11,20 GiB 32k
Mac con M4 y 16 GB unificados sí 13,00 GiB 32k
Portátil de oficina, solo CPU y 16 GB sí 13,00 GiB 32k
Mac mini con M6 y 16 GB unificados sí 13,00 GiB 32k
Mac con M4 Pro y 24 GB sí 21,00 GiB 64k
Estación con RTX 4090 24 GB sí 23,20 GiB 64k
Mini-PC con NPU y 32 GB LPDDR5X sí 29,00 GiB 128k
Mac mini con M6 y 32 GB unificados sí 29,00 GiB 128k
Servidor con 2× RTX 3090 (48 GB) sí 47,20 GiB 128k
Mac con M4 Max y 64 GB sí 61,00 GiB 128k
Mac mini con M5 Pro y 64 GB unificados sí 61,00 GiB 128k
Xiaomi AI Cube, 80 GB — prototipo de ingeniería sí 77,00 GiB 128k
PC con Ryzen AI Max+ 395 y 128 GB unificados sí 96,00 GiB 128k
Mac Studio con M5 Max y 128 GB unificados sí 125,00 GiB 128k
PC con Ryzen AI Max+ PRO 495 y 192 GB unificados sí 160,00 GiB 128k
Mac Studio con M5 Ultra y 512 GB unificados sí 509,00 GiB 128k