Un modelo cabe cuando entran a la vez su fichero de pesos, la memoria de contexto y el margen del programa que lo ejecuta, en lo que queda después de que el sistema coja lo suyo. Con 8 GB de tarjeta gráfica caben 5 de los 18 modelos que medimos a 8k de contexto, y bajan a 3 con un contrato de 12.000 palabras en español.
La segunda cifra es la que no viene al lado del precio. El resto de esta página explica de dónde sale.
Cuánta memoria te queda de verdad
Un equipo de 16 GB no ofrece 16 GB. Reservamos 0,8 GiB en tarjetas gráficas dedicadas y 3 GiB en memoria unificada o de sistema, que es lo que se lleva el sistema operativo.
| Equipo | Memoria para el modelo | Caben a 8k | Caben a 32k |
|---|---|---|---|
| PC con RTX 4060 8 GB | 7,20 GiB | 5 de 18 | 3 de 18 |
| PC con RTX 3060 12 GB | 11,20 GiB | 6 de 18 | 6 de 18 |
| PC con RTX 4070 12 GB | 11,20 GiB | 6 de 18 | 6 de 18 |
| Mac con M4 y 16 GB unificados | 13,00 GiB | 7 de 18 | 7 de 18 |
| Portátil de oficina, solo CPU y 16 GB | 13,00 GiB | 7 de 18 | 7 de 18 |
| Mac con M4 Pro y 24 GB | 21,00 GiB | 13 de 18 | 11 de 18 |
| Estación con RTX 4090 24 GB | 23,20 GiB | 14 de 18 | 13 de 18 |
| Mini-PC con NPU y 32 GB LPDDR5X | 29,00 GiB | 14 de 18 | 14 de 18 |
| Mac con M4 Max y 64 GB | 61,00 GiB | 15 de 18 | 15 de 18 |
Calculado por Local AI Scope. «Cabe» = pesos + memoria de contexto + margen del programa ≤ memoria disponible, con el fichero en Q4_K_M o en la compresión más cercana que publique el autor. Q4_K_M como suelo es un criterio editorial declarado, no una medición: por debajo la calidad se degrada, pero cuánto no lo hemos medido.
Ninguna máquina llega a 18. Tres modelos no caben en ninguna de las diez: glm-5.2 (433,83 GiB), deepseek-v4-flash (127,28 GiB) y llama4-scout-17b (60,87 GiB). El techo real de esta tabla es 15 de 18.
El salto de 8 a 12 GB añade exactamente un modelo, gemma4-12b: la lista de 12 GB contiene la de 8 GB y uno más. Lo que de verdad compra ese salto es margen, no variedad. El salto que cambia la película es el de 24 GB, donde se pasa de 6 a 14.
Dónde deja de servir la comparación en inglés
El contexto se reserva en tokens, y el mismo texto no son los mismos tokens en español que en inglés: entre 1,16 y 1,35 veces más según el modelo, medido con el tokenizador real de cada uno sobre un corpus paralelo propio (sha256[:16] 2f6c96b6ea0b161f).
Con un contrato de 12.000 palabras, así queda el recuento:
| Equipo | Inglés | Español | Francés | Alemán |
|---|---|---|---|---|
| PC con RTX 4060 8 GB | 4 | 3 | 3 | 2 |
| PC con RTX 3060 12 GB | 6 | 6 | 6 | 3 |
| PC con RTX 4070 12 GB | 6 | 6 | 6 | 3 |
| Mac con M4 y 16 GB | 7 | 7 | 7 | 4 |
| Portátil sin GPU, 16 GB | 7 | 7 | 7 | 4 |
| Mac con M4 Pro y 24 GB | 12 | 11 | 11 | 9 |
| Estación con RTX 4090 24 GB | 14 | 13 | 13 | 10 |
| Servidor con 2× RTX 3090 (48 GB) | 14 | 14 | 14 | 12 |
| Mac con M4 Max y 64 GB | 15 | 15 | 15 | 13 |
Medido por Local AI Scope. Documento tipo contrato, 600 palabras de respuesta; el contexto se calcula con la fertilidad real de cada modelo y se redondea al escalón del programa. Mismo criterio de encaje que la tabla anterior.
El español cuesta un modelo en tres de las nueve máquinas: la de 8 GB, el M4 Pro y la RTX 4090. El alemán lo paga en las nueve.
Por qué el documento largo lo cambia todo
Con documentos cortos el idioma no mueve nada. Midiendo en pasos de 100 palabras sobre los diez equipos, con un documento tipo contrato el español no quita ningún modelo hasta las 4.100 palabras; el alemán empieza mucho antes, a las 2.600.
La razón es el escalón. El programa reserva el contexto en potencias de dos, así que la diferencia se absorbe hasta que cruza un umbral y entonces salta de golpe:
| Modelo | Contexto en inglés | En español |
|---|---|---|
gemma4-12b |
16k | 32k |
gpt-oss-20b |
16k | 32k |
mistral-small-24b |
16k | 32k |
Contrato de 12.000 palabras. Doblar el contexto reservado no dobla la memoria total, pero en un equipo justo es lo que decide.
Conclusión práctica para comprar: si tu trabajo son correos y notas, el idioma da igual. Si son contratos, expedientes o documentación larga en español, cuenta con el escalón de arriba.
Qué mirar antes de pagar
- La memoria de la tarjeta, no el modelo de la tarjeta. Una RTX 4070 de 12 GB y una RTX 3060 de 12 GB hacen caber exactamente los mismos seis modelos. La 4070 los ejecuta más rápido; no hace caber ninguno más.
- El tamaño real del fichero publicado, no el número de parámetros.
gemma4-12bocupa 6,63 GiB yqwen3-coder-30bocupa 17,28 GiB: el segundo no entra en ninguna máquina de 12 GB por mucho que la ficha diga «30B». - La memoria unificada del Mac no es memoria de gráfica. Un Mac de 16 GB deja 13 GiB y hace caber siete modelos, dos más que una 4060 de 8 GB, a bastante menos velocidad.
- El ancho de banda decide la velocidad, no el encaje. El portátil sin GPU de la tabla hace caber los mismos siete modelos que el Mac M4 de 16 GB, y son exactamente los mismos siete, a 83 GB/s frente a 120 GB/s.
Lo que aquí no se mide
Se mide el coste del idioma en tokens y lo que eso obliga a reservar. No se mide la calidad de la respuesta en español: eso exige ejecutar los modelos y evaluar lo que contestan, hace falta una GPU que no tenemos, y llamar «benchmark» a una fórmula es exactamente el error que este sitio existe para no cometer.
Las velocidades que aparecen junto a cada encaje son estimadas, a partir del ancho de banda del fabricante y de eficiencias supuestas. No deciden si algo cabe.
Calcúlalo con tu equipo
El buscador de modelos hace esta cuenta con tu máquina, tu documento y tu idioma para los 18 modelos, y funciona entero en tu navegador: lo que describas no sale de él. Si prefieres empezar por la máquina, las fichas de equipo traen las dos listas, la de lo que cabe y la de lo que no. Y el programa con el que lo vas a ejecutar también decide: está en las fichas de programas.