InicioProgramasllama.cpp

Ficha de programa

llama.cpp

Versión vigente v0.2.0 (canal estable) / b10618 (compilacion diaria)2026-08-21 (v0.2.0) / 2026-08-25 (b10618)Árbol auditado master, commit eb25b7263e1604b4382295563f5a924002d6f87c (2026-08-25)Licencia MIT

Para quien quiere control total y el hardware más raro soportado, y no le importa la terminal.

El motor. Es la implementación en C/C++ sobre la que se apoyan casi todos los demás programas de IA local de consumo, y se puede usar directamente: una herramienta de línea de comandos y un servidor con su propia interfaz web.

De un vistazo
Versión y ritmo de publicaciónv0.2.0 (canal estable) / b10618 (compilacion diaria)
En qué dirección escucha127.0.0.1:8080
Pasos hasta el primer token2 pasos
Sitios a los que llama de fábrica4
LicenciaMIT
2

Pasos hasta el primer token

Medido por Local AI Scope

4

Sitios a los que llama de fábrica

Medido por Local AI Scope

MIT

Licencia

Medido por Local AI Scope

Método

Cómo lo hemos comprobado

Todo lo que esta ficha dice sobre la red sale de leer el código publicado y la documentación oficial en la fecha indicada, no de observar el tráfico. No hemos ejecutado el programa con un analizador de red delante, así que esto es análisis estático, no observación. Una captura real sigue pendiente; el día que la haya, estas celdas suben un nivel de evidencia. Preferimos decirlo a que des por hecho que hemos mirado los paquetes.

Hacia fuera

Qué sale de tu equipo

Las cuatro preguntas que un programa local tiene que contestar antes de merecer tus documentos: qué manda por su cuenta, a quién más llama, en qué dirección escucha y si puedes comprobarlo tú mismo.

Telemetría de fábrica

Ninguna, y aquí eso es un hecho, no una promesa. Verificado por nosotros en la fuente primaria

Barrimos el árbol entero en el commit eb25b72 buscando telemetry, analytics, posthog, mixpanel, sentry.io, google-analytics y gtag( en todos los ficheros .c, .cpp, .h, .hpp, .ts, .tsx, .svelte y .js: ni una coincidencia real. Los únicos dominios escritos en el código son URL de documentación dentro de comentarios. No hay ningún punto al que mandar datos de uso. Es además el único de los cinco que no comprueba actualizaciones: con un fichero de modelo local no abre ni una conexión.

Cómo se apaga: No hay nada que apagar: no la hay.

Fuente · consultado el 2026-08-25

Otras llamadas a casa

Todas las llamadas que este programa hace por su cuenta: qué, adónde, cuándo y si se pueden evitar
Qué A dónde Cuándo Se puede evitar Evidencia
Descarga de modelos huggingface.co Solo si usas -hf, –model-url o el subcomando de descarga. Con un fichero local no abre nada. Sí manda un agente de usuario que identifica la compilación. Usar ficheros locales verificado por nosotros
Descarga de modelos empaquetados como imagen de contenedor auth.docker.io · registry-1.docker.io Solo con la opción –docker-repo. No usarla verificado por nosotros
Interfaz web precompilada, al COMPILAR huggingface.co Solo al compilar desde el código con la opción por defecto activada. Sin red, avisa y compila sin interfaz. LLAMA_USE_PREBUILT_UI=OFF verificado por nosotros
Auto-actualización manual llama.app Solo si ejecutas a mano el subcomando de actualización, y solo en instalaciones hechas con su script. Nunca se dispara sola. No ejecutarlo verificado por nosotros

Fuente · consultado el 2026-08-25

En qué dirección escucha

La dirección, la autenticación y la política CORS con las que viene este programa
Ajuste De fábrica
Escucha en 127.0.0.1:8080
Autenticación de fábrica ninguna
CORS de fábrica Refleja cualquier Origin y permite credenciales; el servidor avisa por consola cuando además no hay clave

Escucha en localhost, y siempre ha sido así: en la historia completa del repositorio, de las 719 revisiones de los ficheros que declaran el host, 471 declaran 127.0.0.1 y ninguna declara otra cosa. El precio de ese sigilo es el CORS: el servidor refleja cualquier Origin y permite credenciales, así que cualquier página web que visites puede hablar con tu llama-server mientras esté arrancado. Él mismo lo avisa por consola cuando además no hay clave. Es también el único de los cinco que aprieta su política de CORS según lo peligroso que sea lo que expone: activar las herramientas de agente —que incluyen leer, escribir y editar ficheros y ejecutar comandos— hace que se repliegue a orígenes de localhost. Verificado por nosotros en la fuente primaria

«By default the server reflects any Origin header back with credentials allowed. […] CORS is set to allow all origins (‘*’) and no API key is set — this can be a security risk (cross-origin attacks).»

Fuente · consultado el 2026-08-25

¿Se puede auditar?

Sí, y es la razón por la que esta fila puede decir ninguna sobre telemetría sin sonrojarse. MIT, con el motor entero, el servidor y la interfaz web en un solo repositorio público. Es el único de los cinco del que podemos afirmar, habiendo leído el código, que ni manda telemetría ni comprueba actualizaciones. Verificado por nosotros en la fuente primaria

Fuente · consultado el 2026-08-25

Política de privacidad

No hay política de privacidad, y aquí eso no es una carencia: no existe ningún servicio detrás del programa ni responsable del tratamiento a quien exigírsela. sin verificar

Cobertura

Qué ejecuta y dónde

Plataformas, aceleradores y formatos de modelo: los tres muros con los que se choca la primera noche, y los que nadie escribe hasta haberse chocado.

Dónde funciona

Soporte por plataforma, una fila por plataforma
Plataforma Soporte Evidencia
Windows Sí: binarios precompilados para x64 y ARM64, en variantes de CPU, CUDA, Vulkan, ROCm, SYCL, OpenVINO y OpenCL/Adreno. Instalable con winget. verificado por nosotros
macOS Apple Silicon Sí: binario precompilado y paquete de Homebrew, MacPorts o Nix. verificado por nosotros
macOS Intel Sí, pero solo por CPU. Hay binario para Mac Intel y el flujo de publicación lo compila con Metal desactivado a propósito: el comentario de su propio fichero dice que las máquinas de compilación no tienen GPU. verificado por nosotros
Linux Sí: x64, ARM64 e incluso s390x (IBM Z), en variantes de CPU, Vulkan, ROCm, SYCL y OpenVINO. verificado por nosotros
+ Android ARM64 y un xcframework para iOS/macOS. Documenta además compilaciones para RISC-V. verificado por nosotros

Qué acelera

Aceleradores de hardware y su estado
Motor Estado Evidencia
CUDA Sí, pero el binario existe solo para Windows. En Linux hay que compilar o usar Docker, lo que convierte al caso más común del mundo, NVIDIA sobre Linux, en el único sin compilación lista. verificado por nosotros
ROCm Sí, con binario: ROCm 7.14, en Windows y en Linux. verificado por nosotros
Metal Sí, embebido en el binario de macOS ARM64. Desactivado en Mac Intel. verificado por nosotros
Vulkan Sí, con binario: x64 y ARM64 en Linux, x64 en Windows. verificado por nosotros
CPU Sí, con SIMD por arquitectura. Es la razón de existir del proyecto. verificado por nosotros
SYCL / OpenCL / OpenVINO Sí: SYCL para Intel, OpenCL/Adreno para móviles Qualcomm, y OpenVINO. verificado por nosotros
NPU No lo hemos podido verificar. Publica binarios con backend OpenVINO, que es la pila de Intel para acelerar en CPU, GPU y NPU, pero ninguna afirmación oficial dice que llama.cpp haga inferencia en la NPU, así que no lo damos por bueno. sin verificar

Formatos de modelo que ejecuta

Solo GGUF. GGUF es su formato nativo: lo inventó este proyecto. Los safetensors hay que convertirlos antes con el script que trae el propio repositorio. verificado por nosotros

Fuente · consultado el 2026-08-25

Convivir

Instalarlo y convivir con él

Cuántos pasos hasta el primer token, qué deja en tu disco, bajo qué licencia y a qué ritmo cambia por debajo.

Pasos hasta el primer token

2 pasos. Instalar el paquete y ejecutar `llama serve -hf <repo-de-hugging-face>`: descarga el modelo y abre la interfaz web. Lo que sube la dificultad no es instalarlo, sino que todo se configura por parámetros de línea de comandos. verificado por nosotros

Qué escribe en tu disco

Qué escribe este programa en tu disco y dónde
Qué Dónde Evidencia
Modelos descargados con -hf: la caché estándar de Hugging Face, compartida con los demás programas que la usan, así que no duplica descargas ~/.cache/huggingface/hub — la caché de Hugging Face (LLAMA_CACHE → HF_HUB_CACHE → HF_HOME/hub → XDG_CACHE_HOME) verificado por nosotros
Otros artefactos y la caché del servidor RPC $LLAMA_CACHE · $XDG_CACHE_HOME · ~/.cache/llama.cpp/ verificado por nosotros
Conversaciones de la interfaz web: en tu navegador, no en el servidor En tu navegador, no en el servidor: IndexedDB (base LlamaUi) y localStorage con prefijo LlamaUi. Se borran vaciando los datos del sitio y no se sincronizan entre navegadores verificado por nosotros
Caché de prompts: en memoria, no en disco, salvo que la pidas En memoria, no en disco (8192 MiB por defecto). Solo llega al disco con –slot-save-path o –prompt-cache verificado por nosotros
Registros: solo si los pides Solo con –log-file; el volcado de prompts a disco (–log-prompts-dir) viene desactivado verificado por nosotros

Licencia

MIT. El motor entero, el servidor y la interfaz web. verificado por nosotros

Fuente · consultado el 2026-08-25

Versión y ritmo de publicación

Dos ritmos. El canal de desarrollo publica unas ocho compilaciones al día (266 en 30 días). El canal estable acaba de nacer, el 21 de agosto de 2026, y va por la cuarta etiqueta en total. verificado por nosotros

«tag vX.Y.Z – stable, slower release cadence, recommended for downstream distribution and casual users; tag b[NUM] – bleeding edge, faster release cadence, recommended for developers and technical users.»

Fuente · consultado el 2026-08-25

Avisos

Lo que conviene saber antes de instalarlo

  • Es el único de los cinco del que podemos afirmar, habiendo leído el código, que no manda telemetría ni comprueba actualizaciones. Con un fichero de modelo local no abre una sola conexión.
  • Desde el 21 de agosto de 2026 ya hay canal estable (v0.2.0) además del de compilaciones diarias. Cualquier texto que diga «llama.cpp no tiene versiones estables» ya está desfasado. Ojo: el paquete de winget sigue distribuyendo la compilación diaria.
  • El precio de ese sigilo es el CORS: el servidor refleja cualquier origen y permite credenciales, así que cualquier página web que visites puede hablar con tu llama-server mientras esté arrancado. El propio servidor lo avisa por consola. Se acota con –cors-origins localhost.
  • El caso más común del mundo —NVIDIA sobre Linux— es justo el que no tiene binario precompilado: hay que compilar o usar Docker.
  • Su servidor auxiliar de cómputo distribuido lleva un aviso tajante en su propia documentación: el backend RPC es una prueba de concepto, frágil e insegura, y nunca debe ejecutarse en una red abierta.