¿Qué IA local puedes ejecutar de verdad?
Dile qué equipo tienes, con qué trabajas y cómo de delicado es ese trabajo. Te responde con mediciones: qué cabe, cuánto contexto puedes permitirte, cuánto vas a esperar y si mantenerlo en local es siquiera la decisión correcta.
Tres cifras que ninguna calculadora de VRAM te enseña
Cada una es reproducible a partir del método publicado, y cada una cambia una decisión que alguien está a punto de tomar.
Lo que la fórmula genérica de VRAM sobreestima la memoria de un modelo de 2026 con 32k de contexto. La mayoría de las calculadoras la sigue usando, así que le dicen a la gente que algo no cabe cuando sí cabe.
Medido por Local AI ScopeLo que cuesta el mismo documento en alemán frente al inglés, en tokens, con la familia Qwen3. Los tokens se pagan en contexto, en memoria y en la factura de la nube.
Medido por Local AI ScopeDe 640 situaciones probadas en las que cambiar solo el idioma cambia el contexto que hay que reservar. En un 14,4 % cambia directamente el modelo recomendado.
Medido por Local AI ScopeCinco entradas, según lo que ya sepas
Todas terminan en una ficha con sus medidas y su fecha, no en un formulario de registro.
Le dices tu equipo y responde con medidas
Tu GPU o tu Mac, el tipo de trabajo, lo sensibles que son los datos y el idioma en el que escribes. Devuelve qué cabe, con cuánto contexto, cuánto tarda la primera palabra y si lo local es la opción adecuada. Sin correo, sin cuenta, nada sale de tu navegador.
10 perfiles de equipo · 18 modelos · 4 idiomasModelosCada modelo medido con los ficheros publicados reales
No parámetros multiplicados por bits: el fichero que el autor publicó, más la memoria de contexto calculada capa por capa.
1,03 → 433,83 GiBHardwareDiez equipos, y lo que queda de verdad
Cuánta memoria sobrevive cuando el sistema se lleva su parte, y qué modelos caben en el resto — con las dos listas, los que caben y los que no.
7,20 → 61,00 GiB libresRuntimesCinco programas, leídos en su código fuente
Qué telemetría traen de fábrica, a quién más llaman, en qué dirección escuchan y si alguien de fuera de la empresa puede comprobarlo.
3 de 5 auditablesGuíasLas respuestas largas, con las cuentas a la vista
Por qué la fórmula habitual exagera la caché, cuánto cuesta un token en tu idioma y qué tarjeta merece el dinero.
Método a la vista, paso a pasoDe dónde sale cada número
El tamaño de cada modelo es el del fichero real publicado por su autor. La memoria de contexto se calcula con el patrón de atención declarado capa a capa en la configuración oficial, no con la fórmula genérica: en gemma-4-12B a 32k, esa fórmula da 12,00 GiB donde la memoria real es 2,31 GiB. El coste de cada idioma se mide ejecutando el tokenizador de cada modelo sobre un corpus paralelo: el mismo contenido en los cuatro idiomas.
Lo que todavía no está medido: si un modelo escribe mejor en francés o en alemán. Eso exige ejecutarlos y evaluarlos, y hasta que exista esa medición esta herramienta no lo afirma. Las velocidades son estimaciones a partir de las especificaciones del fabricante; nunca deciden si algo cabe.
Lo que se pregunta la gente antes de fiarse de una cifra
¿Por qué tu calculadora dice que un modelo cabe cuando otras dicen que no?
Porque la caché de contexto se calcula a partir del patrón de atención que cada modelo declara capa por capa, no con la fórmula de manual. gemma4-12b declara 48 capas y solo 8 son de atención completa; las otras 40 se deslizan sobre 1024 tokens y nunca guardan más. Con 32k eso son 2,31 GiB de caché real frente a los 12,00 GiB que devuelve la fórmula genérica.
¿De verdad el idioma en el que trabajo cambia qué modelo debo usar?
Sí, y está medido, no discutido. El mismo contrato de 12 000 palabras cuesta ×1,62 más tokens en alemán que en inglés con la familia Qwen3. En el 30,6 % de las 640 situaciones probadas, cambiar solo el idioma cambia el contexto que hay que reservar; en el 14,4 % cambia directamente el modelo recomendado.
¿Sabéis si un modelo escribe mejor en francés o en alemán?
No, y este sitio no lo afirma. Medir la calidad de las respuestas por idioma exige ejecutar y evaluar los modelos, y eso no lo hemos hecho. Lo que aquí se mide es lo que un idioma cuesta en tokens — y los tokens son lo que se paga en contexto, en memoria y en una factura de nube. Cualquier cosa sobre la calidad sería una opinión disfrazada de cifra.
¿Sale de mi navegador algo de lo que escribo en la herramienta?
No. El Model Finder lo calcula todo en local a partir de un conjunto de datos que la página ya ha descargado. No hay cuenta, ni campo de correo, ni ninguna petición que lleve tus respuestas. Las dos tipografías se sirven desde el propio sitio por la misma razón: nada de esta página le pide nada a un tercero.
Averigua qué puede mover tu propio equipo
Diez perfiles de equipo, dieciocho modelos, cuatro idiomas. Responde en tu navegador y dice de dónde sale cada cifra.
Buscar una configuración para mi equipo