Programas
Cinco programas para ejecutar un modelo en tu propio equipo. Esta tabla contesta lo que sus webs no contestan: si mandan datos de uso sin pedirte permiso, a quién más llaman, en qué dirección escuchan y, sobre todo, si alguien de fuera puede comprobarlo. Todo lo de aquí se leyó en el código publicado y en la documentación oficial el 25 de agosto de 2026; nada sale de observar el tráfico de red.
Las cuatro preguntas que importan
| Programa | Telemetría de fábrica | Otras llamadas a casa | En qué dirección escucha | ¿Se puede auditar? |
|---|---|---|---|---|
| Ollama | Sin analítica de terceros, pero llama a casa verificado por nosotros | Actualizaciones cada hora (no se puede apagar) y catálogo remoto cada 4 h (OLLAMA_NO_CLOUD) verificado por nosotros | 127.0.0.1:11434, sin clave, CORS permisivo verificado por nosotros | Sí — MIT, código público verificado por nosotros |
| LM Studio | Declara que no tiene declarado por el fabricante | Comprobación de actualizaciones (sin interruptor documentado) y búsqueda de modelos declarado por el fabricante | 127.0.0.1:1234, sin clave, pero CORS desactivado y claves de API disponibles declarado por el fabricante | No — código cerrado, ingeniería inversa prohibida verificado por nosotros |
| llama.cpp | Ninguna verificado por nosotros | Ninguna: no comprueba actualizaciones ni nada más verificado por nosotros | 127.0.0.1:8080, sin clave, CORS que refleja cualquier origen verificado por nosotros | Sí — MIT, código público verificado por nosotros |
| MLX (mlx-lm) | Ninguna propia; hereda la de la librería de descarga verificado por nosotros | Solo la descarga de modelos (HF_HUB_DISABLE_TELEMETRY / HF_HUB_OFFLINE) verificado por nosotros | 127.0.0.1:8080, sin clave, CORS abierto de par en par verificado por nosotros | Sí — MIT, código público verificado por nosotros |
| vLLM | Sí, activada de fábrica — latido cada 10 min a stats.vllm.ai verificado por nosotros | Descarga de modelos identificándose ante Hugging Face como vLLM; endpoint local de métricas verificado por nosotros | 0.0.0.0:8000 — todas las interfaces, sin clave verificado por nosotros | Sí — Apache-2.0, código público verificado por nosotros |
Cada celda de estas cuatro columnas dice cómo lo sabemos: ● verificado por nosotros en la fuente primaria, ◐ declarado por el fabricante y sin verificación independiente, ○ no lo hemos podido verificar. Lee la última columna primero: uno de estos cinco no lo puede auditar nadie ajeno a la empresa, y eso convierte su fila entera de hecho en promesa. Nada de esto sale de observar el tráfico de red: leímos el código publicado y la documentación oficial.
Todo lo demás
| Programa | Qué resuelve | Dónde funciona | Qué acelera | Formatos | Pasos hasta el primer token | Licencia | Qué guarda en tu disco |
|---|---|---|---|---|---|---|---|
| Ollama | Un modelo respondiendo en dos minutos, sin tocar parámetros. | Windows · macOS Apple Silicon · macOS Intel (solo CPU) · Linux (sin app de escritorio) | CUDA, ROCm, Metal, Vulkan (activado de fábrica), CPU. NPU no. | GGUF y safetensors | 2 pasos, sin compilar | MIT | Sí: conversaciones en una base SQLite sin cifrar |
| LM Studio | Todo en pantalla, sin línea de comandos en ningún momento. | Windows (AVX2) · macOS Apple Silicon · macOS Intel no · Linux (solo AppImage) | CUDA, ROCm, Metal, Vulkan, CPU — según fuente de enero de 2025. NPU: sin verificar. | GGUF y MLX | 3 pasos, sin terminal | Propietaria. Gratis en el trabajo; no se puede revender como servicio | Sí: conversaciones en JSON en claro |
| llama.cpp | Control total y el hardware más raro soportado, terminal incluida. | Windows · macOS Apple Silicon · macOS Intel (solo CPU) · Linux · Android, iOS, RISC-V, s390x | CUDA (binario solo en Windows), ROCm, Metal, Vulkan, SYCL, OpenVINO, OpenCL, CPU | Solo GGUF | 2 pasos, sin compilar en el caso normal | MIT | En el servidor no: en el navegador (IndexedDB) |
| MLX (mlx-lm) | Máximo rendimiento nativo en un Mac con Apple Silicon, con Python de por medio. | macOS Apple Silicon · Linux para el framework · Windows sin documentar · macOS Intel no | Metal (memoria unificada), CUDA en Linux, CPU. Neural Engine: no. | MLX y safetensors. GGUF no | 2 pasos, pip | MIT | Las conversaciones no se guardan |
| vLLM | Servir un modelo a cien personas, no a ti. | Linux · macOS Apple Silicon (experimental, CPU, compilando) · Windows solo por WSL · macOS Intel: sin verificar | CUDA (primera clase), ROCm, CPU. Metal solo por complemento externo. | safetensors y cuantizaciones; GGUF solo por complemento externo | 2 pasos, pip — pero sin interfaz de ningún tipo | Apache-2.0 | No se guardan (no tiene interfaz de chat) |
Estas columnas salen de las mismas fuentes primarias. Cada dato lleva su propia procedencia dentro de la ficha de su programa, con cita y enlace.