Inicio›Equipos›PC con RTX 4070 12 GB
PC con RTX 4070 12 GB
Tarjeta gráfica NVIDIA12 GiB504 GB/s29,1 TFLOPS
Este equipo deja 11,20 GiB para el modelo una vez el sistema coge lo suyo, y admite 6 de los 18 modelos que medimos en la compresión de referencia. Lo que decide su velocidad de respuesta no es el chip: son los 504 GB/s de ancho de banda de memoria.
Queda para el modelo
Estimación propia
Ancho de banda de memoria
Estimación propia
Modelos que caben
Medido por Local AI Scope
La memoria que de verdad puedes usar
Por esto la cifra de la caja no es la cifra que tienes. El escritorio, el compositor y el contexto gráfico no devuelven lo suyo, y un modelo que no les deja sitio no arranca: se cae.
| Memoria | GiB |
|---|---|
| Memoria del equipo | 12 |
| Reservada al sistema | −0,80 |
| Queda para el modelo | 11,20 |
Ancho de banda de memoria
Son dos límites distintos y se confunden constantemente. Mientras el modelo escribe la respuesta manda el ancho de banda: cada token obliga a releer los pesos enteros, así que los tokens por segundo son aproximadamente el ancho de banda dividido entre el tamaño del modelo. Mientras el modelo lee tu documento manda el cómputo: la entrada se procesa de una vez. Por eso un portátil sin GPU puede tardar minutos en soltar la primera palabra y luego escribir a un ritmo tolerable.
504 GB/s — Derivado, no publicado por el fabricante · el fabricante publica el ancho del bus pero ni la velocidad de la memoria ni el ancho de banda. Esta cifra es la derivación aritmética habitual (21 Gbps x 192 bit / 8 = 504 GB/s) y no hemos podido confirmarla en origen (Fuente).
Cómputo: 29,1 TFLOPS (TFLOPS FP32 de shaders) — Declarado por el fabricante, con otro nombre · el fabricante publica este número como TFLOPS FP32 de shaders, no como FP16; contrastado con la página del fabricante el 2026-08-25 (Fuente). Las cifras de esta línea no salen todas de la misma medida según el equipo, porque cada fabricante publica una distinta. Compáralas entre equipos sabiendo eso.
Qué modelos entran aquí y cuáles no
Que quepa significa que caben tres cosas a la vez en la memoria que sobra: el fichero del modelo, su memoria de contexto y el margen de trabajo del runtime. La memoria de contexto se calcula con el patrón de atención que cada modelo declara capa a capa, no con la fórmula genérica: por eso aquí caben modelos que otras calculadoras dan por imposibles.
| Modelo | Compresión mostrada | Tamaño del modelo | 8k | 32k | 128k | Mayor contexto que cabe |
|---|---|---|---|---|---|---|
| qwen3-1.7b | Q4_K_M |
1,03 GiB | sí | sí | — | 32k |
| qwen3-4b-2507 | Q4_K_M |
2,33 GiB | sí | sí | no | 32k |
| gemma4-e2b | Q4_K_M |
2,89 GiB | sí | sí | sí | 128k |
| gemma4-e4b | Q4_K_M |
4,63 GiB | sí | sí | sí | 128k |
| qwen3-8b | Q4_K_M |
4,68 GiB | sí | sí | — | 32k |
| gemma4-12b | Q4_K_M |
6,63 GiB | sí | sí | no | 32k |
| gpt-oss-20b | Q4_K_M |
10,83 GiB | no | no | no | — |
| mistral-small-24b | Q4_K_M |
13,35 GiB | no | no | no | — |
| qwen3.8-27b | Q4_K_M |
15,33 GiB | no | no | no | — |
| qwen3.6-27b | Q4_K_M |
15,66 GiB | no | no | no | — |
| gemma4-26b-a4b | Q4_K_M |
15,78 GiB | no | no | no | — |
| gemma4-31b | Q4_K_M |
17,07 GiB | no | no | no | — |
| qwen3-coder-30b | Q4_K_M |
17,28 GiB | no | no | no | — |
| qwen3.6-35b-a3b | Q4_K_M |
20,61 GiB | no | no | no | — |
| gpt-oss-120b | Q4_K_M |
58,46 GiB | no | no | no | — |
| llama4-scout-17b | Q4_K_M |
60,87 GiB | no | no | no | — |
| deepseek-v4-flash | IQ4_XS |
127,28 GiB | no | no | no | — |
| glm-5.2 | Q4_K_M |
433,83 GiB | no | no | no | — |
Los tamaños son los de los ficheros realmente publicados en la compresión de referencia, un escalón por fila: Q4_K_M donde el autor la publica y el vecino más cercano donde no. Cada fila dice cuál está enseñando. Q4_K_M es nuestro suelo de calidad: por debajo la pérdida se nota en las respuestas. Un modelo que solo cabría aquí con una compresión más agresiva figura como que no cabe, a propósito. Un guion en una columna de contexto significa que el modelo no ofrece ese contexto, así que no hay nada que encajar.
Modelos que caben — 6 de los 18 modelos medidos
- qwen3-1.7b
Q4_K_M— contexto 32k tokens - qwen3-4b-2507
Q4_K_M— contexto 32k tokens - gemma4-e2b
Q4_K_M— contexto 128k tokens - gemma4-e4b
Q4_K_M— contexto 128k tokens - qwen3-8b
Q4_K_M— contexto 32k tokens - gemma4-12b
Q4_K_M— contexto 32k tokens
Modelos que no caben — 12 de los 18 modelos medidos
- gpt-oss-20b
Q4_K_M— le faltan 0,40 GiB - mistral-small-24b
Q4_K_M— le faltan 3,45 GiB - qwen3.8-27b
Q4_K_M— le faltan 5,06 GiB - qwen3.6-27b
Q4_K_M— le faltan 5,39 GiB - gemma4-26b-a4b
Q4_K_M— le faltan 5,61 GiB - gemma4-31b
Q4_K_M— le faltan 7,95 GiB - qwen3-coder-30b
Q4_K_M— le faltan 7,13 GiB - qwen3.6-35b-a3b
Q4_K_M— le faltan 10,17 GiB - gpt-oss-120b
Q4_K_M— le faltan 48,08 GiB - llama4-scout-17b
Q4_K_M— le faltan 51,10 GiB - deepseek-v4-flash
IQ4_XS— le faltan 117,09 GiB - glm-5.2
Q4_K_M— le faltan 437,93 GiB