Metodología y etiquetas de evidencia
Un número sin origen y sin fecha no es evidencia: es una afirmación. Esta página explica de dónde sale cada cifra de Local AI Scope, qué significa cada etiqueta y —igual de importante— qué no está medido.
1. Las etiquetas de evidencia
Cada dato publicado lleva una de estas cinco etiquetas. Se distinguen por texto e icono, nunca solo por color.
| Etiqueta | Qué significa exactamente | Qué se permite sostener con ella |
|---|---|---|
Measured by Local AI Scope |
Lo hemos ejecutado nosotros, con un protocolo escrito y reproducible: se publica qué versión, qué equipo, qué configuración y qué fecha | Sí, incluida una recomendación, indicando el intervalo y el número de repeticiones |
Community verified |
Lo ha enviado alguien de fuera y ha superado los controles de coherencia del sitio; no lo hemos ejecutado nosotros | Sí, con la confianza menor indicada de forma visible |
Estimated |
Es el resultado de una fórmula, no de una ejecución. La fórmula está publicada y se puede rehacer | Como orientación. Nunca se presenta como si fuera un banco de pruebas |
Vendor declared |
Lo declara el fabricante en una fuente primaria: ficha técnica, fichero de configuración o licencia | Para hechos declarados (tamaño, licencia, contexto máximo). No para afirmar rendimiento |
Stale |
El dato ha superado su fecha de caducidad: una versión nueva, un precio viejo | No sostiene ninguna recomendación destacada. Se conserva visible, con su fecha, como histórico |
2. De dónde sale cada cifra
Tamaño del modelo
Es el tamaño del fichero realmente publicado para esa cuantización, no el resultado de multiplicar parámetros por bits. Etiqueta: Vendor declared.
Memoria de contexto
Se calcula capa a capa, usando el patrón de atención que cada modelo declara en su fichero de configuración oficial. Esto importa mucho más de lo que parece: los modelos de 2026 ya no usan atención completa en todas sus capas, y la fórmula genérica que emplean la mayoría de las calculadoras trata todas las capas por igual. En un caso comprobado, esa fórmula genérica pedía 12,00 GiB donde el cálculo real sobre la configuración publicada da 2,31 GiB: una sobreestimación de ×5,2. Traducido: otras herramientas le dicen a alguien con 12 GB que un modelo no le cabe, y sí le cabe. Etiqueta: Estimated, con la fórmula publicada.
Coste del idioma
Es la medición propia del sitio. Se ejecuta el tokenizador real de cada modelo —el programa que trocea el texto en unidades de cobro— sobre un corpus paralelo propio y versionado: los mismos textos, de cuatro tipos distintos, traducidos a los cuatro idiomas. Se compara cuántas unidades cuesta decir exactamente lo mismo en cada lengua. Etiqueta: Measured by Local AI Scope.
El resultado es que la penalización por idioma no depende de la familia del modelo sino de la generación de su tokenizador, y que además varía con el tipo de texto: con un mismo modelo, un contrato en alemán puede costar bastante más que un correo en alemán. Por eso el idioma de trabajo es una entrada de la herramienta y no un detalle.
Velocidad
Es estimación declarada a partir del ancho de banda de memoria y la potencia de cálculo que declara el fabricante, con supuestos de eficiencia. No decide si un modelo cabe o no cabe; sí puede inclinar la vía recomendada cuando el equipo va justo, y en esos casos se dice en la propia línea. Etiqueta: Estimated.
3. Cómo se identifica una medición
Una velocidad no es un dato si no se sabe sobre qué se midió. La identidad de cada medición es la combinación completa: modelo, versión, artefacto, cuantización, runtime y su versión, sistema operativo, controlador, hardware, tarea, idioma, protocolo y fecha. Así una configuración nueva no se confunde con un dato nuevo, y una mejora no se registra como una regresión.
4. Los controles
Un método que solo se prueba con los casos que le salen bien no es un método. Cada versión del motor de cálculo pasa dos controles opuestos antes de publicarse:
- Un control positivo: una combinación que tiene que caber y que debe salir como que cabe.
- Un control negativo: una combinación que no puede caber y que debe salir rechazada, con la cifra que falta.
Si cualquiera de los dos falla, no se publica.
5. Lo que NO está medido
Lo medido es el coste del idioma, no la calidad en ese idioma. Saber que un modelo cabe y cuánto le cuesta trabajar en alemán no dice si responde bien en alemán: para eso hay que ejecutar los modelos y evaluar sus respuestas con un protocolo propio, y eso todavía no se ha hecho. Ninguna página de este sitio afirma «calidad lingüística medida». Cuando exista esa medición, aparecerá aquí con su protocolo, su fecha y su etiqueta.
6. Caducidad y actualizaciones
Cada campo tiene su propia caducidad: un precio caduca antes que una licencia. Cuando un dato la supera, se marca Stale, deja de sostener recomendaciones destacadas y permanece visible con su fecha en lugar de desaparecer. Todo dato publicado lleva la fecha de su última comprobación.
7. Reproducibilidad y correcciones
El objetivo es que cualquiera pueda rehacer los cálculos: las fórmulas se publican, las fuentes primarias se enlazan y el corpus de medición está versionado con su huella. Si reproduces una cifra y no te sale, es información valiosa: escribe al correo del aviso legal. Las correcciones se publican fechadas, como explica la política editorial.