Instala Ollama, deja que la aplicación o ollama serve arranque el servidor y abre http://127.0.0.1:11434/: si contesta «Ollama is running», funciona, y solo tu equipo llega a él. Callado no está. Con la aplicación de escritorio abierta, Ollama llama a ollama.com 30 veces al día por su cuenta, y 24 no se pueden apagar.
Instalarlo es cosa de minutos. Lo que pide decisión viene después: en qué dirección escucha el servidor, qué manda mientras no lo usas y dónde acaban tus modelos y tus conversaciones. Esta guía va en ese orden, con los comandos de la versión estable vigente, la 0.35.0 (publicada el 28 de septiembre de 2026). Los leímos en la 0.34.4 y ninguno cambia en la 0.35.0: su código cambia en la aplicación de escritorio, en la herramienta de pruebas de velocidad y en una dirección nueva para modelos de decisión, no en los comandos, las variables ni el script de instalación que se usan aquí.
Cómo instalar Ollama en Mac, Windows y Linux
Hay una línea por sistema, y cada una te deja algo un poco distinto.
| Sistema | Cómo se instala | Con qué te quedas |
|---|---|---|
| macOS 14 Sonoma o posterior | curl -fsSL https://ollama.com/install.sh | sh o el instalador Ollama.dmg |
La aplicación en Aplicaciones y el comando ollama. Usa la GPU en Apple Silicon; en los Mac con Intel, solo la CPU |
| Windows 10 22H2 o posterior | irm https://ollama.com/install.ps1 | iex en PowerShell, o OllamaSetup.exe |
La aplicación en tu carpeta de usuario, sin permisos de administrador, y ollama en cualquier terminal |
| Linux | curl -fsSL https://ollama.com/install.sh | sh |
Un servicio de systemd llamado ollama que corre con su propio usuario ollama. Sin aplicación de escritorio |
| Docker | docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 --name ollama ollama/ollama |
El servidor dentro de un contenedor. Fíjate en el 127.0.0.1: el motivo va más abajo |
Comandos y requisitos tal como los publica Ollama en su README y en sus páginas de macOS, Windows y Linux de la versión 0.34.4, leídas el 25 de septiembre de 2026. La línea de Docker es la suya, con el puerto atado a 127.0.0.1.
Lee el script antes de ejecutarlo. https://ollama.com/install.sh redirige al install.sh que va adjunto a la última versión publicada en GitHub; el 25 de septiembre de 2026 era idéntico, byte a byte, al de la etiqueta v0.34.4. En un Mac, ese mismo script instala la aplicación de escritorio, y eso importa para lo que viene: es la aplicación la que añade la comprobación de actualizaciones cada hora.
ollama serve: ¿hace falta lanzarlo a mano?
Casi nunca. En macOS y en Windows, la aplicación de escritorio arranca ollama serve ella sola al abrirse. En Linux, el instalador crea un servicio cuyo único trabajo es ollama serve, y sudo systemctl enable ollama hace que vuelva a arrancar con cada reinicio.
Solo lo escribes tú en tres casos: una instalación manual desde el paquete comprimido, un servidor que quieres ver en directo en la terminal, o una ejecución puntual con otros ajustes:
OLLAMA_DEBUG=1 ollama serve
ollama serve --help enseña las variables de entorno que lee el servidor. Si la aplicación o el servicio ya están en marcha, un segundo ollama serve se pelea con el primero por el puerto 11434. Cierra uno antes.
Cómo saber si Ollama está funcionando
Cuatro comprobaciones, de la más básica a la que más dice.
El servidor responde. Abre http://127.0.0.1:11434/ en el navegador, o desde la terminal:
curl http://127.0.0.1:11434/
Ollama is running
Qué versión contesta. La API tiene una dirección para eso, y la línea de comandos hace la misma pregunta:
curl http://127.0.0.1:11434/api/version
{"version":"0.35.0"}
ollama -v
ollama version is 0.35.0
Si ollama -v escribe Warning: could not connect to a running Ollama instance, el comando está instalado pero no hay ningún servidor arrancado. Si añade Warning: client version is …, el comando y el servidor son de versiones distintas, y eso suele querer decir que tienes dos instalaciones.
Qué hay cargado, y dónde. ollama ps lista los modelos que están en memoria con las columnas NAME, ID, SIZE, PROCESSOR, CONTEXT y UNTIL. La que hay que leer es PROCESSOR: 100% GPU quiere decir que el modelo entero está en la tarjeta gráfica; 100% CPU, que está en la memoria del sistema, y un reparto como 48%/52% CPU/GPU, que no cabía y va más lento de lo que podría.
El servicio, en Linux. sudo systemctl status ollama te dice si está activo y desde cuándo.
Modo verbose y registros: son dos cosas distintas
El modo verbose mide la velocidad. ollama run <modelo> --verbose, o /set verbose dentro de una conversación, imprime tiempos después de cada respuesta: total duration, load duration, prompt eval rate y eval rate, estas dos últimas en tokens por segundo. /set quiet lo vuelve a quitar.
El registro de depuración cuenta lo que hace el servidor. OLLAMA_DEBUG=1 sube el registro a nivel de depuración y OLLAMA_DEBUG=2, a traza. Dónde se pone depende de cómo corra Ollama:
# Servicio de Linux: añade Environment="OLLAMA_DEBUG=1" bajo [Service]
sudo systemctl edit ollama
sudo systemctl daemon-reload
sudo systemctl restart ollama
# Aplicación de macOS: ponla, y luego cierra y vuelve a abrir Ollama
launchctl setenv OLLAMA_DEBUG 1
# Windows: cierra antes la aplicación desde la bandeja y, en PowerShell
$env:OLLAMA_DEBUG="1"
& "ollama app.exe"
Los registros están en ~/.ollama/logs/server.log en un Mac, en %LOCALAPPDATA%\Ollama\server.log en Windows, en journalctl -u ollama --no-pager --follow --pager-end en Linux y en docker logs ollama si va en un contenedor.
Opciones, variables y rutas de registro de las páginas de resolución de problemas y preguntas frecuentes de Ollama y de su código fuente, versión 0.34.4, leídos el 25 de septiembre de 2026.
En qué dirección escucha Ollama y por qué no tiene contraseña
127.0.0.1:11434 de fábrica. Solo los programas de tu propio equipo llegan a él. Es lo sensato, y lo que conviene dejar.
OLLAMA_HOST=0.0.0.0:11434 lo pone a escuchar en todas las interfaces de red, y ahí hay algo que el nombre de la variable no cuenta: la API local no tiene autenticación de ninguna clase. OLLAMA_AUTH no lo arregla; solo hace que el cliente de la línea de comandos firme sus propias peticiones. Y en cuanto el servidor deja de estar en la dirección de bucle local, también deja de comprobar la cabecera Host, que es una de las dos defensas que le quedaban. Cualquiera que llegue a ese puerto puede usar tus modelos y tu tarjeta gráfica. La aplicación de escritorio tiene un ajuste que hace exactamente eso, poner OLLAMA_HOST=0.0.0.0, y viene apagado.
Si lo necesitas desde otro ordenador, deja el servidor donde está y llévate el puerto por SSH:
ssh -L 11434:127.0.0.1:11434 tu-usuario@el-equipo-con-ollama
Mientras esa sesión esté abierta, http://127.0.0.1:11434/ en tu portátil es el Ollama remoto, y el Ollama remoto sigue cerrado para todos los demás.
Docker es donde más fácil resulta equivocarse. La imagen de Ollama pone OLLAMA_HOST=0.0.0.0:11434 dentro del contenedor, que lo necesita, y un -p 11434:11434 a secas publica el puerto en todas las direcciones del equipo, según la propia documentación de Docker. De ahí el 127.0.0.1: delante del puerto en la tabla de arriba.
La otra defensa es el CORS, y es más permisiva de lo que la dirección hace pensar: sin configurar nada, Ollama acepta peticiones del navegador que vengan de páginas servidas en localhost en cualquier puerto, de ficheros abiertos en el navegador (file://) y de extensiones. OLLAMA_ORIGINS añade a esa lista; no la sustituye.
Qué manda Ollama por su cuenta y qué puedes apagar
Esto es lo que la pantalla de instalación no cuenta. Con el programa abierto y tú sin tocar nada, estas son las llamadas que hace:
| Llamada | A dónde | Al día | ¿Se puede apagar? |
|---|---|---|---|
| Comprobación de actualizaciones, firmada con una clave guardada en tu equipo; en macOS lleva además un identificador persistente del dispositivo | ollama.com/api/update |
24 (cada hora, mientras la aplicación de escritorio está abierta; en Linux no existe) | No. El ajuste de actualización automática solo evita la descarga, no la comprobación |
Catálogo remoto de modelos recomendados, que lo arranca el propio ollama serve: sin aplicación y sin cuenta |
ollama.com/api/experimental/model-recommendations |
6 (cada 4 horas) | Sí: OLLAMA_NO_CLOUD=1 |
Contado por Local AI Scope a partir de la cadencia escrita en el código publicado de Ollama (versión 0.32.15, leído el 25 de agosto de 2026), no de una captura de tráfico. Los dos intervalos son los mismos en el código de la 0.34.4, que volvimos a leer el 25 de septiembre de 2026. La ficha completa, con cada fuente: Ollama: qué manda a casa y si lo puedes auditar.
Suman 30 llamadas al día en un Mac o en un PC con Windows con la aplicación abierta, y 24 de ellas no las puedes impedir. Un servidor Linux sin aplicación de escritorio hace 6, y las 6 se pueden apagar. Descargar un modelo no cuenta aquí: eso pasa cuando tú lo pides, desde registry.ollama.ai, y con los modelos públicos sale sin ninguna credencial.
La petición del catálogo va firmada. Desde la versión 0.34.4, la llamada al catálogo cada 4 horas sale firmada con ~/.ollama/id_ed25519, la clave que identifica tu instalación frente a ollama.com y la misma que firma la comprobación de actualizaciones. Pasa también en un servidor Linux sin aplicación de escritorio, y OLLAMA_NO_CLOUD=1, el interruptor que viene a continuación, la corta. Lo que no corta es la consulta de cuenta que hace la aplicación de escritorio al abrirse: una petición firmada a ollama.com/api/me, aunque no tengas cuenta. No está entre las 30 porque no va con reloj: sale cuando abres la aplicación.
Cómo se apaga lo que se puede apagar. En el servicio de Linux, añade Environment="OLLAMA_NO_CLOUD=1" igual que la línea de depuración de antes. En un Mac o en Windows, escribe este fichero, que leen tanto el servidor como la aplicación:
# ~/.ollama/server.json
{
"disable_ollama_cloud": true
}
Reinicia Ollama y busca Ollama cloud disabled: true en el registro: esa línea es tu confirmación. El mismo interruptor apaga los modelos :cloud y la búsqueda web, y de eso se trata: un modelo cuyo nombre acaba en :cloud no se ejecuta en tu equipo. Es la misma línea de comandos y el mismo catálogo, y tu pregunta viaja a los servidores de Ollama. Si solo usas modelos locales, tampoco necesitas nunca ollama signin. Y si prefieres que la línea de comandos no guarde lo que escribes, OLLAMA_NOHISTORY=1 hace que deje de escribir en ~/.ollama/history.
Ninguna de estas llamadas lleva tus preguntas. La política de privacidad de Ollama (marzo de 2026) dice que no ve tus prompts ni tus datos cuando lo ejecutas en local, y que puede recoger metadatos limitados del dispositivo y de uso, como la versión de la aplicación y el número de peticiones. Eso es palabra del fabricante, y el código que hemos leído no la contradice. Lo que no hemos hecho es poner un analizador de red delante del programa: esto es una lectura del código, no una grabación del tráfico.
Dónde guarda Ollama los modelos y las conversaciones
Los modelos ocupan de decenas a cientos de gigas, así que el sitio importa antes de la primera descarga.
| Qué | Dónde |
|---|---|
| Modelos, macOS | ~/.ollama/models |
| Modelos, Windows | C:\Users\%username%\.ollama\models |
| Modelos, servicio de Linux | /usr/share/ollama/.ollama/models |
| Clave que identifica tu instalación ante ollama.com | ~/.ollama/id_ed25519 y su .pub (servicio de Linux: /usr/share/ollama/.ollama/) |
| Conversaciones de la aplicación, en una base de datos SQLite sin cifrar | macOS ~/Library/Application Support/Ollama/db.sqlite · Windows %LOCALAPPDATA%\Ollama\db.sqlite |
Rutas tal como las publica Ollama en sus preguntas frecuentes y leídas en su código fuente, versión 0.34.4, el 25 de septiembre de 2026.
OLLAMA_MODELS lleva los modelos a la carpeta que quieras. En Linux, el usuario ollama tiene que ser dueño de la carpeta nueva: sudo chown -R ollama:ollama <carpeta>. La base de datos de conversaciones no sale nunca del equipo, y cualquiera que pueda abrir ficheros en tu usuario puede leerla.
Qué modelo descargar primero
El modelo se elige después de instalar, no antes. El fichero tiene que caber en la memoria que te queda junto con la conversación, y un modelo que se desborda hacia el procesador se nota en ese reparto de ollama ps. El buscador de modelos te dice qué modelos caben en tu equipo con una compresión que no estropea las respuestas y qué longitud de documento aguantan, y funciona entero en tu navegador. Para saber qué hace un modelo local y qué no frente al que usas hoy, los números están en Qué IA puedes instalar en tu PC (y qué vas a echar de menos de ChatGPT).
El orden que te deja un Ollama que funciona y habla lo justo:
- Instálalo con la línea de tu sistema.
- Comprueba
http://127.0.0.1:11434/yollama -v. - Escribe
~/.ollama/server.jsoncondisable_ollama_cloud(en el servicio de Linux, la líneaEnvironment), reinicia y busca la línea de confirmación en el registro. - No toques
OLLAMA_HOST; si otro equipo lo necesita, túnel SSH. - Descarga un modelo que quepa, ejecútalo con
--verbosey mira queollama psdiga100% GPU.
Si lo que no te encaja es la comprobación de actualizaciones de cada hora, es cosa de la aplicación de escritorio, no del servidor. Los cinco programas se comparan justo en esto en 5 programas de IA local: telemetría, llamadas y auditoría: llama.cpp, por ejemplo, no hace ninguna llamada por su cuenta, y LM Studio es el único de los cinco cuyo código nadie de fuera puede revisar.