llama.cpp
Versión vigente v0.2.0 (canal estable) / b10618 (compilacion diaria)2026-08-21 (v0.2.0) / 2026-08-25 (b10618)Árbol auditado master, commit eb25b7263e1604b4382295563f5a924002d6f87c (2026-08-25)Licencia MIT
Para quien quiere control total y el hardware más raro soportado, y no le importa la terminal.
El motor. Es la implementación en C/C++ sobre la que se apoyan casi todos los demás programas de IA local de consumo, y se puede usar directamente: una herramienta de línea de comandos y un servidor con su propia interfaz web.
Pasos hasta el primer token
Medido por Local AI Scope
Sitios a los que llama de fábrica
Medido por Local AI Scope
Licencia
Medido por Local AI Scope
Cómo lo hemos comprobado
Todo lo que esta ficha dice sobre la red sale de leer el código publicado y la documentación oficial en la fecha indicada, no de observar el tráfico. No hemos ejecutado el programa con un analizador de red delante, así que esto es análisis estático, no observación. Una captura real sigue pendiente; el día que la haya, estas celdas suben un nivel de evidencia. Preferimos decirlo a que des por hecho que hemos mirado los paquetes.
Qué sale de tu equipo
Las cuatro preguntas que un programa local tiene que contestar antes de merecer tus documentos: qué manda por su cuenta, a quién más llama, en qué dirección escucha y si puedes comprobarlo tú mismo.
Telemetría de fábrica
Ninguna, y aquí eso es un hecho, no una promesa. Verificado por nosotros en la fuente primaria
Barrimos el árbol entero en el commit eb25b72 buscando telemetry, analytics, posthog, mixpanel, sentry.io, google-analytics y gtag( en todos los ficheros .c, .cpp, .h, .hpp, .ts, .tsx, .svelte y .js: ni una coincidencia real. Los únicos dominios escritos en el código son URL de documentación dentro de comentarios. No hay ningún punto al que mandar datos de uso. Es además el único de los cinco que no comprueba actualizaciones: con un fichero de modelo local no abre ni una conexión.
Cómo se apaga: No hay nada que apagar: no la hay.
Fuente · consultado el 2026-08-25
Otras llamadas a casa
| Qué | A dónde | Cuándo | Se puede evitar | Evidencia |
|---|---|---|---|---|
| Descarga de modelos | huggingface.co |
Solo si usas -hf, –model-url o el subcomando de descarga. Con un fichero local no abre nada. Sí manda un agente de usuario que identifica la compilación. | Usar ficheros locales | verificado por nosotros |
| Descarga de modelos empaquetados como imagen de contenedor | auth.docker.io · registry-1.docker.io |
Solo con la opción –docker-repo. | No usarla | verificado por nosotros |
| Interfaz web precompilada, al COMPILAR | huggingface.co |
Solo al compilar desde el código con la opción por defecto activada. Sin red, avisa y compila sin interfaz. | LLAMA_USE_PREBUILT_UI=OFF | verificado por nosotros |
| Auto-actualización manual | llama.app |
Solo si ejecutas a mano el subcomando de actualización, y solo en instalaciones hechas con su script. Nunca se dispara sola. | No ejecutarlo | verificado por nosotros |
Fuente · consultado el 2026-08-25
En qué dirección escucha
| Ajuste | De fábrica |
|---|---|
| Escucha en | 127.0.0.1:8080 |
| Autenticación de fábrica | ninguna |
| CORS de fábrica | Refleja cualquier Origin y permite credenciales; el servidor avisa por consola cuando además no hay clave |
Escucha en localhost, y siempre ha sido así: en la historia completa del repositorio, de las 719 revisiones de los ficheros que declaran el host, 471 declaran 127.0.0.1 y ninguna declara otra cosa. El precio de ese sigilo es el CORS: el servidor refleja cualquier Origin y permite credenciales, así que cualquier página web que visites puede hablar con tu llama-server mientras esté arrancado. Él mismo lo avisa por consola cuando además no hay clave. Es también el único de los cinco que aprieta su política de CORS según lo peligroso que sea lo que expone: activar las herramientas de agente —que incluyen leer, escribir y editar ficheros y ejecutar comandos— hace que se repliegue a orígenes de localhost. Verificado por nosotros en la fuente primaria
«By default the server reflects any Origin header back with credentials allowed. […] CORS is set to allow all origins (‘*’) and no API key is set — this can be a security risk (cross-origin attacks).»
Fuente · consultado el 2026-08-25
¿Se puede auditar?
Sí, y es la razón por la que esta fila puede decir ninguna sobre telemetría sin sonrojarse. MIT, con el motor entero, el servidor y la interfaz web en un solo repositorio público. Es el único de los cinco del que podemos afirmar, habiendo leído el código, que ni manda telemetría ni comprueba actualizaciones. Verificado por nosotros en la fuente primaria
Fuente · consultado el 2026-08-25
Política de privacidad
No hay política de privacidad, y aquí eso no es una carencia: no existe ningún servicio detrás del programa ni responsable del tratamiento a quien exigírsela. sin verificar
Qué ejecuta y dónde
Plataformas, aceleradores y formatos de modelo: los tres muros con los que se choca la primera noche, y los que nadie escribe hasta haberse chocado.
Dónde funciona
| Plataforma | Soporte | Evidencia |
|---|---|---|
| Windows | Sí: binarios precompilados para x64 y ARM64, en variantes de CPU, CUDA, Vulkan, ROCm, SYCL, OpenVINO y OpenCL/Adreno. Instalable con winget. | verificado por nosotros |
| macOS Apple Silicon | Sí: binario precompilado y paquete de Homebrew, MacPorts o Nix. | verificado por nosotros |
| macOS Intel | Sí, pero solo por CPU. Hay binario para Mac Intel y el flujo de publicación lo compila con Metal desactivado a propósito: el comentario de su propio fichero dice que las máquinas de compilación no tienen GPU. | verificado por nosotros |
| Linux | Sí: x64, ARM64 e incluso s390x (IBM Z), en variantes de CPU, Vulkan, ROCm, SYCL y OpenVINO. | verificado por nosotros |
| + | Android ARM64 y un xcframework para iOS/macOS. Documenta además compilaciones para RISC-V. | verificado por nosotros |
Qué acelera
| Motor | Estado | Evidencia |
|---|---|---|
| CUDA | Sí, pero el binario existe solo para Windows. En Linux hay que compilar o usar Docker, lo que convierte al caso más común del mundo, NVIDIA sobre Linux, en el único sin compilación lista. | verificado por nosotros |
| ROCm | Sí, con binario: ROCm 7.14, en Windows y en Linux. | verificado por nosotros |
| Metal | Sí, embebido en el binario de macOS ARM64. Desactivado en Mac Intel. | verificado por nosotros |
| Vulkan | Sí, con binario: x64 y ARM64 en Linux, x64 en Windows. | verificado por nosotros |
| CPU | Sí, con SIMD por arquitectura. Es la razón de existir del proyecto. | verificado por nosotros |
| SYCL / OpenCL / OpenVINO | Sí: SYCL para Intel, OpenCL/Adreno para móviles Qualcomm, y OpenVINO. | verificado por nosotros |
| NPU | No lo hemos podido verificar. Publica binarios con backend OpenVINO, que es la pila de Intel para acelerar en CPU, GPU y NPU, pero ninguna afirmación oficial dice que llama.cpp haga inferencia en la NPU, así que no lo damos por bueno. | sin verificar |
Formatos de modelo que ejecuta
Solo GGUF. GGUF es su formato nativo: lo inventó este proyecto. Los safetensors hay que convertirlos antes con el script que trae el propio repositorio. verificado por nosotros
Fuente · consultado el 2026-08-25
Instalarlo y convivir con él
Cuántos pasos hasta el primer token, qué deja en tu disco, bajo qué licencia y a qué ritmo cambia por debajo.
Pasos hasta el primer token
2 pasos. Instalar el paquete y ejecutar `llama serve -hf <repo-de-hugging-face>`: descarga el modelo y abre la interfaz web. Lo que sube la dificultad no es instalarlo, sino que todo se configura por parámetros de línea de comandos. verificado por nosotros
Qué escribe en tu disco
| Qué | Dónde | Evidencia |
|---|---|---|
| Modelos descargados con -hf: la caché estándar de Hugging Face, compartida con los demás programas que la usan, así que no duplica descargas | ~/.cache/huggingface/hub — la caché de Hugging Face (LLAMA_CACHE → HF_HUB_CACHE → HF_HOME/hub → XDG_CACHE_HOME) |
verificado por nosotros |
| Otros artefactos y la caché del servidor RPC | $LLAMA_CACHE · $XDG_CACHE_HOME · ~/.cache/llama.cpp/ |
verificado por nosotros |
| Conversaciones de la interfaz web: en tu navegador, no en el servidor | En tu navegador, no en el servidor: IndexedDB (base LlamaUi) y localStorage con prefijo LlamaUi. Se borran vaciando los datos del sitio y no se sincronizan entre navegadores | verificado por nosotros |
| Caché de prompts: en memoria, no en disco, salvo que la pidas | En memoria, no en disco (8192 MiB por defecto). Solo llega al disco con –slot-save-path o –prompt-cache | verificado por nosotros |
| Registros: solo si los pides | Solo con –log-file; el volcado de prompts a disco (–log-prompts-dir) viene desactivado | verificado por nosotros |
Licencia
MIT. El motor entero, el servidor y la interfaz web. verificado por nosotros
Fuente · consultado el 2026-08-25
Versión y ritmo de publicación
Dos ritmos. El canal de desarrollo publica unas ocho compilaciones al día (266 en 30 días). El canal estable acaba de nacer, el 21 de agosto de 2026, y va por la cuarta etiqueta en total. verificado por nosotros
«tag vX.Y.Z – stable, slower release cadence, recommended for downstream distribution and casual users; tag b[NUM] – bleeding edge, faster release cadence, recommended for developers and technical users.»
Fuente · consultado el 2026-08-25
Lo que conviene saber antes de instalarlo
- Es el único de los cinco del que podemos afirmar, habiendo leído el código, que no manda telemetría ni comprueba actualizaciones. Con un fichero de modelo local no abre una sola conexión.
- Desde el 21 de agosto de 2026 ya hay canal estable (v0.2.0) además del de compilaciones diarias. Cualquier texto que diga «llama.cpp no tiene versiones estables» ya está desfasado. Ojo: el paquete de winget sigue distribuyendo la compilación diaria.
- El precio de ese sigilo es el CORS: el servidor refleja cualquier origen y permite credenciales, así que cualquier página web que visites puede hablar con tu llama-server mientras esté arrancado. El propio servidor lo avisa por consola. Se acota con –cors-origins localhost.
- El caso más común del mundo —NVIDIA sobre Linux— es justo el que no tiene binario precompilado: hay que compilar o usar Docker.
- Su servidor auxiliar de cómputo distribuido lleva un aviso tajante en su propia documentación: el backend RPC es una prueba de concepto, frágil e insegura, y nunca debe ejecutarse en una red abierta.