Empecemos por la buena noticia: casi cualquier ordenador de los últimos años puede ejecutar una IA local, y tenerla funcionando en tu propia mesa tiene su magia. La otra mitad: lo que no puede ejecutar es la que usas ahora. En una tarjeta gráfica de 8 GB caben 6 de los 20 modelos que medimos junto a un documento de ocho páginas, y el mayor de ellos ocupa 4,98 GiB; el mayor de nuestro catálogo ocupa 433,83 GiB. Todo lo demás de esta página sale de ahí.
Así que no es un motivo para no instalarla. Es el motivo para saber qué estás cambiando antes de dedicarle una tarde.
Qué cambia de verdad cuando el modelo corre en tu máquina
Cambian cuatro cosas, y solo cuatro.
Nada de lo que escribes sale del ordenador. Ni el documento, ni la pregunta, ni el borrador que al final no mandaste. No hay contrato de encargado del tratamiento que firmar, ni cláusula de transferencia internacional que leer, ni casilla de «no entrenéis con mis datos» en la que tener fe. Para cualquier cosa que caiga bajo el RGPD, eso no reduce el trámite: lo elimina.
El coste deja de ser por uso. Pagas una vez el equipo y la luz. No hay taxímetro corriendo mientras pegas un contrato largo y pides el resumen cinco veces.
Funciona con el cable desenchufado. Una vez el fichero está en el disco, un avión, una oficina sin cobertura o una red cerrada dejan de ser un problema.
Y es más pequeño y más lento que aquello a lo que estás acostumbrado. Eso es justo lo que nunca aparece al lado del precio, así que el resto de esta página se dedica a ponerle números.
Cómo contamos, antes de ningún número
Todas las cifras de aquí usan una compresión por modelo: Q4_K_M donde el autor la publica, y el vecino más cercano donde no. Q4_K_M es nuestro suelo de calidad, porque por debajo la pérdida se nota en las respuestas.
Cuánto más pequeño, exactamente
Un modelo local es un fichero, y ese fichero tiene que caber en lo que queda de memoria después de que el sistema coja lo suyo, a la vez que la memoria que ocupa la conversación y el margen de trabajo del programa que lo ejecuta. Reservamos 0,8 GiB en tarjetas gráficas dedicadas y 3 GiB en memoria unificada o de sistema. En los PC con Ryzen AI Max+ manda otro límite: AMD solo deja a la gráfica 96 GiB de 128 GB y 160 GiB de 192 GB.
Con un documento de 4.000 palabras en español:
| Equipo | Memoria para el modelo | Modelos que caben | El mayor que cabe | Ocupa | Distancia a glm-5.2 |
|---|---|---|---|---|---|
| PC con RTX 4060 8 GB | 7,20 GiB | 6 de 20 | granite-4.2-8b |
4,98 GiB | ×87 |
| PC con RTX 3060 12 GB | 11,20 GiB | 7 de 20 | gemma4-12b |
6,63 GiB | ×65 |
| PC con RTX 4070 12 GB | 11,20 GiB | 7 de 20 | gemma4-12b |
6,63 GiB | ×65 |
| Mac con M4 y 16 GB unificados | 13,00 GiB | 8 de 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Portátil de oficina, 16 GB, sin gráfica | 13,00 GiB | 8 de 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Mac mini con M6 y 16 GB | 13,00 GiB | 8 de 20 | gpt-oss-20b |
10,83 GiB | ×40 |
| Mac con M4 Pro y 24 GB | 21,00 GiB | 14 de 20 | qwen3-coder-30b |
17,28 GiB | ×25 |
| Estación con RTX 4090 24 GB | 23,20 GiB | 15 de 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mini-PC con NPU y 32 GB | 29,00 GiB | 15 de 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mac mini con M6 y 32 GB | 29,00 GiB | 15 de 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Servidor con 2× RTX 3090 (48 GB) | 47,20 GiB | 15 de 20 | qwen3.6-35b-a3b |
20,61 GiB | ×21 |
| Mac con M4 Max y 64 GB | 61,00 GiB | 16 de 20 | gpt-oss-120b |
58,46 GiB | ×7 |
| Mac mini con M5 Pro y 64 GB | 61,00 GiB | 16 de 20 | gpt-oss-120b |
58,46 GiB | ×7 |
| Xiaomi AI Cube, 80 GB (prototipo) | 77,00 GiB | 17 de 20 | llama4-scout-17b |
60,87 GiB | ×7 |
| PC con Ryzen AI Max+ 395 y 128 GB | 96,00 GiB | 18 de 20 | qwen3.8-flash-next |
87,25 GiB | ×5 |
| Mac Studio con M5 Max y 128 GB | 125,00 GiB | 18 de 20 | qwen3.8-flash-next |
87,25 GiB | ×5 |
| PC con Ryzen AI Max+ PRO 495 y 192 GB | 160,00 GiB | 19 de 20 | deepseek-v4-flash |
127,28 GiB | ×3 |
| Mac Studio con M5 Ultra y 512 GB | 509,00 GiB | 20 de 20 | glm-5.2 |
433,83 GiB | ×1 |
Calculado por Local AI Scope con los tamaños de fichero publicados y el patrón de atención real de cada modelo, todas las filas a la misma compresión de referencia para que los tamaños sean comparables. Los tamaños salen de las versiones que publica cada autor: glm-5.2, gemma4-12b, gpt-oss-20b. glm-5.2 ocupa 433,83 GiB en Q4_K_M; la versión menos comprimida que catalogamos (Q8_0) ocupa 746,32 GiB.
Lo jugoso de esa tabla no es el múltiplo, son dos cosas que se leen entre líneas. La primera: la escalera solo llega arriba del todo. Un Mac de 64 GB, que no es precisamente un equipo barato, se queda a 7 veces, 128 GB solo lo bajan a 5, 192 GB a 3, y la única máquina de la lista que llega a 20 de 20 es el Mac Studio con M5 Ultra y 512 GB.
Mac Studio con M5 Ultra y 512 GB unificadosFicha del equipo

Cuánto más lento
La velocidad son dos números que se comportan distinto, y confundirlos es lo que provoca la decepción.
Escribir la respuesta lo limita el ancho de banda de la memoria. Leer tu documento antes de soltar la primera palabra lo limita el cálculo bruto. En una conversación corta el segundo número ni se nota; en un documento largo el segundo número lo es todo.
Mismo documento de 4.000 palabras en español, con el mejor modelo para documentos que cabe en cada equipo:
| Equipo | Modelo | Escribe a | Tarda en soltar la primera palabra |
|---|---|---|---|
| Portátil de oficina, 16 GB, sin gráfica | gemma4-12b |
~4,1 tokens/s | ~8 min 53 s |
| Mac con M4 y 16 GB unificados | gemma4-12b |
~9,3 tokens/s | ~1 min 39 s |
| PC con RTX 3060 12 GB | gemma4-12b |
~33 tokens/s | ~29 s |
| PC con RTX 4060 8 GB | qwen3-8b |
~35 tokens/s | ~20 s |
| Estación con RTX 4090 24 GB | qwen3.6-35b-a3b |
~213 tokens/s | ~2 s |
Estimado por Local AI Scope, no medido: la fórmula usa el ancho de banda y el cálculo que declara cada fabricante, con eficiencias conservadoras. Se publica para que puedas comprobarla, y nunca decide si un modelo cabe o no.
Ahora los mismos equipos con un mensaje normal de unas 1.000 palabras. La RTX 4060 espera unos 5 segundos y escribe a unos 33 tokens/s. El portátil sin gráfica espera unos 19 segundos y escribe a unos 17 tokens/s.
PC con RTX 4060 8 GBFicha del equipo¿El español me sale caro?
Menos de lo que parece, y esta es la parte que más nos gusta contar, porque sorprende.
El contexto se reserva en tokens, y el mismo texto no son los mismos tokens en cada idioma. Medido con el tokenizador propio de cada modelo sobre un corpus paralelo nuestro (sha256[:16] 2f6c96b6ea0b161f), un contrato cuesta en español entre 1,13 y 1,39 veces más tokens que en inglés, con una mediana de 1,16 sobre los 20 modelos. El alemán llega a 1,76 y el francés a 1,47.
Lo que sí te cuesta un modelo es la longitud. Midiendo en pasos de 100 palabras, esto es a partir de cuántas palabras el español deja de caber donde cabía el inglés:
| Equipo | En español pierdes un modelo a partir de | En alemán, a partir de |
|---|---|---|
| PC con RTX 4060 8 GB | 4.200 palabras | 2.800 palabras |
| Mac con M4 Pro y 24 GB | 5.200 palabras | 3.700 palabras |
| Mac Studio con M5 Ultra y 512 GB | 9.100 palabras | 6.600 palabras |
| Estación con RTX 4090 24 GB | 10.300 palabras | 7.400 palabras |
| PC con RTX 3060 12 GB | 16.800 palabras | 11.300 palabras |
| PC con RTX 4070 12 GB | 16.800 palabras | 11.300 palabras |
| Mac con M4 y 16 GB | 16.800 palabras | 11.300 palabras |
| Portátil de oficina, 16 GB | 16.800 palabras | 11.300 palabras |
| Mac mini con M6 y 16 GB | 16.800 palabras | 11.300 palabras |
| Mini-PC con NPU y 32 GB | 16.900 palabras | 11.500 palabras |
| Mac mini con M6 y 32 GB | 16.900 palabras | 11.500 palabras |
| Servidor con 2× RTX 3090 (48 GB) | 16.900 palabras | 11.500 palabras |
| Mac con M4 Max y 64 GB | 16.900 palabras | 11.500 palabras |
| Mac mini con M5 Pro y 64 GB | 16.900 palabras | 11.500 palabras |
| Xiaomi AI Cube, 80 GB (prototipo) | 16.900 palabras | 11.500 palabras |
| PC con Ryzen AI Max+ 395 y 128 GB | 16.900 palabras | 11.500 palabras |
| Mac Studio con M5 Max y 128 GB | 16.900 palabras | 11.500 palabras |
| PC con Ryzen AI Max+ PRO 495 y 192 GB | 16.900 palabras | 11.500 palabras |
Medido por Local AI Scope, documento tipo contrato; la respuesta que se reserva es el 10 % de la entrada, con un mínimo de 300 palabras, que es lo que calcula la herramienta. «Pierdes un modelo» = a esa longitud caben menos modelos en español que en inglés en ese mismo equipo.
La culpa es del escalón. El programa reserva el contexto en potencias de dos, así que la diferencia se absorbe hasta que cruzas un umbral y entonces salta de golpe, como la maleta del avión: todo va bien hasta que te pasas de la raya. Fíjate en que la tarjeta pequeña es la que antes lo cruza: con 8 GB el margen es tan estrecho que un informe de nueve páginas ya te quita 2 opciones, mientras que con 12 o 16 GB no tienes que pensar en esto hasta las 16.800 palabras.
¿Me sirve una IA local para el trabajo del día a día, o me voy a arrepentir?
Aquí conviene partir la pregunta en dos, porque cada mitad tiene su propia respuesta.
Trabajos cortos, de una o dos páginas —redactar, reescribir, resumir, preguntar sobre un documento, trabajar sin conexión—: esa es la forma de tarea para la que da un modelo que cabe en un equipo normal, y la privacidad y el coste plano son ganancias de verdad.
Razonar sobre un expediente entero, código a lo largo de todo un proyecto, o cualquier cosa en la que te estuvieras apoyando en el modelo grande: salvo en un Mac Studio de 512 GB, el fichero que tienes en el disco es entre 3 y 87 veces más pequeño que el mayor que catalogamos, según tu equipo, y no hay ajuste que cierre esa distancia.

Lo que aquí no medimos
Cuánta calidad de respuesta se pierde por esa diferencia de tamaño no lo hemos medido, y no le vamos a poner número.
Tampoco medimos la calidad de la respuesta en español: eso exige ejecutar los modelos y evaluar lo que contestan, hace falta una GPU que no tenemos, y llamar «medición» a una fórmula es exactamente el error que este sitio existe para no cometer. Lo que sí medimos es el coste del idioma en tokens y lo que obliga a reservar.
Si alguien te dice que su modelo local «responde en español igual de bien que GPT» sin publicar cómo lo ha medido, está adivinando.
Si vas a comprar algo, compra memoria
Dos reglas aguantan todos los escenarios que hemos pasado por la calculadora.
- La memoria decide qué cabe; el ancho de banda decide a qué velocidad va. Una RTX 4070 de 12 GB y una RTX 3060 de 12 GB hacen caber exactamente los mismos modelos. La 4070 los ejecuta más rápido y no añade ninguno.
- La especificación es el tamaño del fichero, no el número de parámetros.
gemma4-12bocupa 6,63 GiB yqwen3-coder-30bocupa 17,28 GiB: el segundo no entra en ninguna máquina de 12 GB por mucho que su nombre presuma de «30B».

Las fichas de equipo traen las dos listas de cada máquina, la de lo que cabe y la de lo que no, contadas igual que esta página. Y si lo que buscas es la comparativa de compra por equipo, está en qué PC necesitas para IA local. Esa lista se calcula antes de mirar qué está a la venta, tal y como dice nuestra política editorial: aquí ningún equipo sube de puesto por ser más fácil de comprar.
Tres preguntas, y la herramienta las contesta
El buscador de modelos necesita tres respuestas y funciona entero en tu navegador: lo que escribas en él no llega hasta nosotros.
- Qué equipo tienes. Memoria y tipo, no marca. Empieza por el tuyo: RTX 4060 8 GB · RTX 3060 12 GB · Mac M4 16 GB · portátil sin gráfica · RTX 4090 24 GB.
- Qué le vas a dar, de qué largo y en qué idioma. Un correo de 600 palabras y un contrato de 12.000 son problemas de máquinas distintas, y el idioma mueve la respuesta.
- Qué hay en esos datos. Nada delicado, interno de empresa, datos personales, o no puede salir. Solo la última respuesta convierte el veredicto en un requisito en lugar de una preferencia.
Mac con M4 y 16 GB unificadosFicha del equipo
Estación con RTX 4090 24 GBFicha del equipo
Se abre en YouTube (sin cookies) solo si pulsas. Más vídeos en su ficha →
Una diferencia que conviene conocer: la herramienta además te enseña qué cabría si aceptas comprimir por debajo de Q4_K_M, y lo marca cuando lo hace. Las cuentas de esta página nunca lo aceptan.
Y una última cosa, porque decide más que el modelo: el programa con el que lo vas a ejecutar cambia lo que se puede cargar y qué telemetría manda. Está en las fichas de programas.