Ollama installieren, den Server von der App oder mit ollama serve starten lassen und http://127.0.0.1:11434/ aufrufen: Steht dort „Ollama is running“, läuft es, und nur Ihr eigener Rechner kommt heran. Still ist es trotzdem nicht. Bei geöffneter Desktop-App ruft Ollama 30-mal am Tag von sich aus ollama.com an, und 24 dieser Aufrufe lassen sich nicht abschalten.
Die Installation dauert ein paar Minuten. Die eigentlichen Entscheidungen kommen danach: auf welcher Adresse der Server lauscht, was er sendet, während Sie ihn nicht benutzen, und wo Modelle und Chats landen. Diese Anleitung geht genau in dieser Reihenfolge vor, mit den Befehlen der aktuellen stabilen Version 0.35.0 (veröffentlicht am 28. September 2026). Gelesen haben wir sie an 0.34.4, und keiner davon ändert sich in 0.35.0: Deren Code ändert sich in der Desktop-App, im Geschwindigkeitstest-Werkzeug und durch einen neuen Endpunkt für Entscheidungsmodelle, nicht bei den Befehlen, Variablen oder dem Installationsskript, die hier vorkommen.
Ollama installieren unter Linux, Windows und macOS
Pro System gibt es eine Zeile, und jede hinterlässt etwas anderes.
| System | Installation | Was Sie danach haben |
|---|---|---|
| Linux | curl -fsSL https://ollama.com/install.sh | sh |
Einen systemd-Dienst namens ollama, der unter einem eigenen Benutzer ollama läuft. Keine Desktop-App |
| Windows 10 22H2 oder neuer | irm https://ollama.com/install.ps1 | iex in der PowerShell, oder OllamaSetup.exe |
Die App im Benutzerverzeichnis, ohne Administratorrechte, und ollama in jedem Terminal |
| macOS 14 Sonoma oder neuer | curl -fsSL https://ollama.com/install.sh | sh oder das Installationsprogramm Ollama.dmg |
Die App im Programme-Ordner plus den Befehl ollama. GPU auf Apple Silicon, auf Intel-Macs nur die CPU |
| Docker | docker run -d -v ollama:/root/.ollama -p 127.0.0.1:11434:11434 --name ollama ollama/ollama |
Den Server im Container. Achten Sie auf das 127.0.0.1: warum, steht weiter unten |
Befehle und Voraussetzungen, wie Ollama sie in seiner README und auf den Seiten zu Linux, Windows und macOS für Version 0.34.4 veröffentlicht, gelesen am 25. September 2026. Die Docker-Zeile ist die von Ollama, mit dem Port an 127.0.0.1 gebunden.
Erst das Skript lesen, dann ausführen. https://ollama.com/install.sh leitet auf das install.sh weiter, das an der jeweils neuesten Version auf GitHub hängt; am 25. September 2026 war es Byte für Byte dasselbe wie im Tag v0.34.4. Auf dem Mac installiert dasselbe Skript die Desktop-App, und das ist für den Rest wichtig: Die stündliche Update-Prüfung kommt von der App.
ollama serve: Muss man das selbst starten?
Meistens nicht. Unter Linux legt das Installationsskript einen Dienst an, dessen einzige Aufgabe ollama serve ist, und sudo systemctl enable ollama sorgt dafür, dass er nach jedem Neustart wieder läuft. Unter macOS und Windows startet die Desktop-App ollama serve beim Öffnen selbst.
Von Hand tippen Sie es in drei Fällen: bei einer manuellen Installation aus dem Archiv, wenn Sie den Server live im Terminal verfolgen wollen, oder für einen einmaligen Start mit anderen Einstellungen:
OLLAMA_DEBUG=1 ollama serve
ollama serve --help zeigt die Umgebungsvariablen, die der Server liest. Läuft die App oder der Dienst schon, streitet sich ein zweites ollama serve mit ihm um Port 11434. Beenden Sie vorher einen der beiden.
Prüfen, ob Ollama läuft
Vier Prüfungen, von der einfachsten bis zur aussagekräftigsten.
Der Server antwortet. http://127.0.0.1:11434/ im Browser öffnen, oder im Terminal:
curl http://127.0.0.1:11434/
Ollama is running
Welche Version antwortet. Dafür hat die API einen eigenen Endpunkt, und die Kommandozeile stellt dieselbe Frage:
curl http://127.0.0.1:11434/api/version
{"version":"0.35.0"}
ollama -v
ollama version is 0.35.0
Meldet ollama -v Warning: could not connect to a running Ollama instance, ist der Befehl installiert, aber kein Server gestartet. Kommt Warning: client version is … dazu, haben Befehl und Server unterschiedliche Versionen, was meistens zwei Installationen bedeutet.
Was geladen ist, und wo. ollama ps listet die Modelle im Speicher mit den Spalten NAME, ID, SIZE, PROCESSOR, CONTEXT und UNTIL. Entscheidend ist PROCESSOR: 100% GPU heißt, das Modell liegt komplett auf der Grafikkarte; 100% CPU, es liegt im Arbeitsspeicher; eine Aufteilung wie 48%/52% CPU/GPU, es hat nicht hineingepasst und läuft langsamer, als es könnte.
Der Dienst unter Linux. sudo systemctl status ollama zeigt, ob er aktiv ist und seit wann.
Verbose-Modus und Logs: zwei verschiedene Dinge
Der Verbose-Modus misst Tempo. ollama run <Modell> --verbose oder /set verbose mitten im Chat gibt nach jeder Antwort Zeiten aus: total duration, load duration, prompt eval rate und eval rate, die letzten beiden in Tokens pro Sekunde. /set quiet schaltet es wieder ab.
Das Debug-Log erzählt, was der Server tut. OLLAMA_DEBUG=1 hebt das Log auf Debug-Stufe, OLLAMA_DEBUG=2 auf Trace. Wo Sie die Variable setzen, hängt davon ab, wie Ollama läuft:
# Linux-Dienst: Environment="OLLAMA_DEBUG=1" unter [Service] eintragen
sudo systemctl edit ollama
sudo systemctl daemon-reload
sudo systemctl restart ollama
# macOS-App: setzen, dann Ollama beenden und neu öffnen
launchctl setenv OLLAMA_DEBUG 1
# Windows: erst die App im Infobereich beenden, dann in der PowerShell
$env:OLLAMA_DEBUG="1"
& "ollama app.exe"
Die Logs selbst finden Sie unter Linux mit journalctl -u ollama --no-pager --follow --pager-end, unter Windows in %LOCALAPPDATA%\Ollama\server.log, auf dem Mac in ~/.ollama/logs/server.log und im Container mit docker logs ollama.
Optionen, Variablen und Log-Pfade aus Ollamas Seiten zur Fehlerbehebung und FAQ sowie aus dem Quellcode, Version 0.34.4, gelesen am 25. September 2026.
Auf welcher Adresse Ollama lauscht, und warum es kein Passwort hat
Ab Werk 127.0.0.1:11434. Nur Programme auf Ihrem eigenen Rechner erreichen es. Das ist die richtige Voreinstellung, und die, bei der Sie bleiben sollten.
OLLAMA_HOST=0.0.0.0:11434 lässt es auf allen Netzwerkschnittstellen lauschen, und dabei gibt es einen Haken, den der Variablenname nicht verrät: Die lokale API hat keinerlei Authentifizierung. OLLAMA_AUTH ändert daran nichts; es lässt nur den Kommandozeilen-Client seine eigenen Anfragen signieren. Und sobald der Server nicht mehr auf der Loopback-Adresse liegt, prüft er auch den Host-Header nicht mehr, einen seiner zwei verbliebenen Schutzmechanismen. Wer diesen Port erreicht, kann Ihre Modelle und Ihre Grafikkarte benutzen. Die Desktop-App hat eine Einstellung, die genau das tut, nämlich OLLAMA_HOST=0.0.0.0 setzen, und sie ist ab Werk aus.
Brauchen Sie Ollama von einem anderen Rechner aus, lassen Sie den Server, wo er ist, und holen Sie sich den Port per SSH:
ssh -L 11434:127.0.0.1:11434 benutzer@rechner-mit-ollama
Solange diese Sitzung offen ist, ist http://127.0.0.1:11434/ auf Ihrem Laptop das entfernte Ollama, und das entfernte Ollama bleibt für alle anderen zu.
Mit Docker passiert der Fehler am leichtesten. Ollamas Image setzt im Container OLLAMA_HOST=0.0.0.0:11434, was es dort auch braucht, und ein schlichtes -p 11434:11434 veröffentlicht den Port laut Dockers eigener Dokumentation auf allen Adressen des Host-Rechners. Deshalb steht in der Tabelle oben 127.0.0.1: vor dem Port.
Der andere Schutz ist CORS, und der ist lockerer, als die Adresse vermuten lässt: Ohne jede Konfiguration akzeptiert Ollama Browser-Anfragen von Seiten, die auf localhost ausgeliefert werden, auf jedem Port, von im Browser geöffneten Dateien (file://) und von Browser-Erweiterungen. OLLAMA_ORIGINS ergänzt diese Liste; es ersetzt sie nicht.
Was Ollama von sich aus sendet, und was Sie abschalten können
Das ist der Teil, über den der Installationsbildschirm schweigt. Bei geöffnetem Programm und ohne dass Sie etwas tun, sind das die Aufrufe:
| Aufruf | Wohin | Pro Tag | Abschaltbar? |
|---|---|---|---|
| Update-Prüfung, signiert mit einem Schlüssel auf Ihrem Rechner; unter macOS zusätzlich mit einer dauerhaften Gerätekennung | ollama.com/api/update |
24 (stündlich, solange die Desktop-App geöffnet ist; unter Linux gibt es sie nicht) | Nein. Die Auto-Update-Einstellung verhindert nur den Download, nicht die Prüfung |
Entfernter Katalog empfohlener Modelle, gestartet von ollama serve selbst: ohne Desktop-App und ohne Konto |
ollama.com/api/experimental/model-recommendations |
6 (alle 4 Stunden) | Ja: OLLAMA_NO_CLOUD=1 |
Gezählt von Local AI Scope nach der im veröffentlichten Quellcode von Ollama stehenden Taktung (Version 0.32.15, gelesen am 25. August 2026), nicht nach einer Netzwerkaufzeichnung. Beide Intervalle sind im Code von 0.34.4 unverändert, den wir am 25. September 2026 erneut gelesen haben. Das vollständige Datenblatt mit jeder Quelle: Ollama: was es nach Hause sendet und ob prüfbar.
Zusammen sind das 30 Aufrufe am Tag auf einem Mac oder Windows-PC mit geöffneter App, 24 davon nicht zu verhindern. Ein Linux-Server ohne Desktop-App kommt auf 6, und alle 6 lassen sich abschalten. Das Herunterladen eines Modells zählt hier nicht mit: Das passiert, wenn Sie es anstoßen, von registry.ollama.ai, und bei öffentlichen Modellen ohne jede Anmeldeinformation.
Die Katalog-Anfrage ist signiert. Seit Version 0.34.4 geht der Katalog-Aufruf alle 4 Stunden mit ~/.ollama/id_ed25519 signiert hinaus, dem Schlüssel, der Ihre Installation gegenüber ollama.com identifiziert, und demselben, der die Update-Prüfung signiert. Das gilt auch auf einem Linux-Server ohne Desktop-App, und OLLAMA_NO_CLOUD=1, der Schalter aus dem nächsten Absatz, kappt ihn. Was er nicht kappt, ist die Kontoabfrage, die die Desktop-App beim Öffnen macht: eine signierte Anfrage an ollama.com/api/me, auch wenn Sie kein Konto haben. Sie zählt nicht zu den 30, weil sie an keinem Takt hängt, sondern beim Öffnen der App hinausgeht.
So schalten Sie ab, was sich abschalten lässt. Beim Linux-Dienst tragen Sie Environment="OLLAMA_NO_CLOUD=1" ein, genauso wie die Debug-Zeile oben. Auf dem Mac oder unter Windows legen Sie diese Datei an, die sowohl der Server als auch die App lesen:
# ~/.ollama/server.json
{
"disable_ollama_cloud": true
}
Ollama neu starten und im Log nach Ollama cloud disabled: true suchen: Diese Zeile ist Ihre Bestätigung. Derselbe Schalter deaktiviert die :cloud-Modelle und die Websuche, und genau darum geht es: Ein Modell, dessen Name auf :cloud endet, läuft nicht auf Ihrem Rechner. Gleiche Kommandozeile, gleicher Katalog, und Ihre Frage geht an die Server von Ollama. Wer nur lokale Modelle nutzt, braucht auch nie ollama signin. Und wenn die Kommandozeile nicht mitschreiben soll, was Sie tippen, verhindert OLLAMA_NOHISTORY=1 das Schreiben nach ~/.ollama/history.
Keiner dieser Aufrufe transportiert Ihre Eingaben. Ollamas Datenschutzerklärung (März 2026) sagt, man sehe Ihre Prompts und Daten bei lokaler Nutzung nicht, könne aber begrenzte Geräte- und Nutzungsmetadaten erheben, etwa die App-Version und die Zahl der Anfragen. Das ist eine Herstellerangabe, und der Code, den wir gelesen haben, widerspricht ihr nicht. Was wir nicht getan haben: einen Netzwerkanalysator vor das Programm zu setzen. Das hier ist eine Lektüre des Codes, keine Aufzeichnung des Datenverkehrs.
Wo Ollama Modelle und Chats ablegt
Modelle belegen Dutzende bis Hunderte Gigabyte, der Speicherort zählt also schon vor dem ersten Download.
| Was | Wo |
|---|---|
| Modelle, Linux-Dienst | /usr/share/ollama/.ollama/models |
| Modelle, Windows | C:\Users\%username%\.ollama\models |
| Modelle, macOS | ~/.ollama/models |
| Schlüssel, der Ihre Installation gegenüber ollama.com identifiziert | ~/.ollama/id_ed25519 und .pub (Linux-Dienst: /usr/share/ollama/.ollama/) |
| Chats der Desktop-App, in einer unverschlüsselten SQLite-Datenbank | macOS ~/Library/Application Support/Ollama/db.sqlite · Windows %LOCALAPPDATA%\Ollama\db.sqlite |
Pfade, wie Ollamas FAQ sie veröffentlicht und wie sie im Quellcode von Version 0.34.4 stehen, gelesen am 25. September 2026.
Mit OLLAMA_MODELS legen Sie die Modelle in einen beliebigen Ordner. Unter Linux muss der Benutzer ollama Eigentümer des neuen Ordners sein: sudo chown -R ollama:ollama <Ordner>. Die Chat-Datenbank verlässt den Rechner nie, und wer Dateien in Ihrem Benutzerkonto öffnen kann, kann sie lesen.
Welches Modell Sie zuerst laden
Das Modell wählen Sie nach der Einrichtung, nicht davor. Die Datei muss zusammen mit dem Gespräch in den verbleibenden Speicher passen, und ein Modell, das auf den Prozessor ausweicht, erkennen Sie sofort an der Aufteilung in ollama ps. Der Modellfinder zeigt, welche Modelle auf Ihrem Rechner bei einer Kompression laufen, die die Antworten nicht verdirbt, und wie lang ein Dokument sein darf; er läuft vollständig in Ihrem Browser. Wer auf Deutsch arbeitet, zahlt dabei einen Aufschlag, und wie groß er ist, steht in Lokale KI auf Deutsch: was wirklich auf Ihren Rechner passt.
Die Reihenfolge, nach der Sie ein Ollama haben, das läuft und so wenig wie möglich sendet:
- Mit der Zeile für Ihr System installieren.
http://127.0.0.1:11434/undollama -vprüfen.~/.ollama/server.jsonmitdisable_ollama_cloudanlegen (beim Linux-Dienst dieEnvironment-Zeile), neu starten und die Bestätigungszeile im Log suchen.OLLAMA_HOSTin Ruhe lassen; braucht ein anderer Rechner Zugriff, SSH-Tunnel.- Ein Modell laden, das passt, mit
--verbosestarten und prüfen, obollama ps100% GPUanzeigt.
Stört Sie vor allem die stündliche Update-Prüfung, dann liegt das an der Desktop-App, nicht am Server. Genau daran werden die fünf Programme in 5 Programme für lokale KI: Telemetrie, Aufrufe, Audit verglichen: llama.cpp etwa macht keinen einzigen Aufruf von sich aus, und LM Studio ist das einzige der fünf, dessen Code niemand von außen prüfen kann.