Un modelo que cabe en inglés puede no caber en alemán.
Las calculadoras de VRAM contestan «¿cabe?» con una fórmula que ignora dos cosas: cómo guardan la memoria los modelos de 2026 y cuántos tokens cuesta decir lo mismo en cada lengua. Aquí las dos están medidas.
De dónde sale cada número
El tamaño de cada modelo es el del fichero real publicado por su autor. La memoria de contexto se calcula con el patrón de atención declarado capa a capa en la configuración oficial, no con la fórmula genérica: en gemma-4-12B a 32k, esa fórmula da 12,00 GiB donde la memoria real es 2,31 GiB. El coste de cada idioma se mide ejecutando el tokenizador de cada modelo sobre un corpus paralelo: el mismo contenido en los cuatro idiomas.
Lo que todavía no está medido: si un modelo escribe mejor en francés o en alemán. Eso exige ejecutarlos y evaluarlos, y hasta que exista esa medición esta herramienta no lo afirma. Las velocidades son estimaciones a partir de las especificaciones del fabricante; nunca deciden si algo cabe.