Startseite›Programme›llama.cpp
llama.cpp
Aktuelle Version v0.2.0 (canal estable) / b10618 (compilacion diaria)2026-08-21 (v0.2.0) / 2026-08-25 (b10618)Geprüfter Stand master, commit eb25b7263e1604b4382295563f5a924002d6f87c (2026-08-25)Lizenz MIT
Für alle, die volle Kontrolle und die breiteste Hardware-Unterstützung wollen und denen das Terminal nichts ausmacht.
Der Motor. Es ist die C/C++-Implementierung, auf der fast alle anderen Consumer-Programme für lokale KI aufsetzen, und man kann sie direkt benutzen: ein Kommandozeilenwerkzeug und ein Server mit eigener Weboberfläche.
Schritte bis zum ersten Token
Von Local AI Scope gemessen
Hosts, die es ab Werk kontaktiert
Von Local AI Scope gemessen
Lizenz
Von Local AI Scope gemessen
Wie wir das geprüft haben
Alles, was dieses Blatt über das Netz sagt, stammt aus dem Lesen des veröffentlichten Quellcodes und der offiziellen Dokumentation zum angegebenen Datum — nicht aus der Beobachtung des Datenverkehrs. Wir haben das Programm nicht mit einem Netzwerkanalysator laufen lassen: Das ist statische Analyse, keine Beobachtung. Eine echte Aufzeichnung steht noch aus; sobald es sie gibt, steigen diese Zellen eine Evidenzstufe. Das sagen wir lieber, als Sie annehmen zu lassen, wir hätten die Pakete mitgelesen.
Was Ihren Rechner verlässt
Die vier Fragen, die ein lokales Programm beantworten muss, bevor es Ihre Dokumente verdient: Was schickt es von sich aus hinaus, wen ruft es sonst noch, auf welcher Adresse hört es, und können Sie das selbst nachprüfen?
Telemetrie ab Werk
Überhaupt keine — und hier ist das eine Tatsache, kein Versprechen. Von uns an der Primärquelle geprüft
Wir haben den gesamten Baum beim Commit eb25b72 nach telemetry, analytics, posthog, mixpanel, sentry.io, google-analytics und gtag( in allen .c-, .cpp-, .h-, .hpp-, .ts-, .tsx-, .svelte- und .js-Dateien durchsucht: kein einziger echter Treffer. Die einzigen im Code stehenden Domains sind Dokumentations-URLs in Kommentaren. Es gibt keinen Endpunkt, an den Nutzungsdaten gingen. Es ist außerdem das einzige der fünf, das nicht auf Updates prüft: Mit einer lokalen Modelldatei öffnet es keine einzige Verbindung.
So schaltet man es ab: Nichts abzuschalten: Es gibt sie nicht.
Quelle · abgerufen am 2026-08-25
Andere Rufe nach Hause
| Was | Wohin | Wann | Vermeidbar | Beleg |
|---|---|---|---|---|
| Modell-Download | huggingface.co |
Nur bei -hf, –model-url oder dem Download-Unterbefehl. Mit einer lokalen Datei öffnet es nichts. Es sendet allerdings eine User-Agent-Kennung des Builds. | Lokale Dateien verwenden | von uns geprüft |
| Download von Modellen, die als Container-Image verpackt sind | auth.docker.io · registry-1.docker.io |
Nur mit der Option –docker-repo. | Nicht benutzen | von uns geprüft |
| Vorgebaute Weboberfläche, beim KOMPILIEREN | huggingface.co |
Nur beim Bauen aus dem Quellcode mit der eingeschalteten Standardoption. Ohne Netz warnt es und baut ohne Oberfläche. | LLAMA_USE_PREBUILT_UI=OFF | von uns geprüft |
| Manuelle Selbstaktualisierung | llama.app |
Nur wenn Sie den Update-Unterbefehl selbst ausführen, und nur bei Installationen über ihr Skript. Sie läuft nie von allein an. | Nicht ausführen | von uns geprüft |
Quelle · abgerufen am 2026-08-25
Auf welcher Adresse es lauscht
| Einstellung | Ab Werk |
|---|---|
| Lauscht auf | 127.0.0.1:8080 |
| Authentifizierung ab Werk | keine |
| CORS ab Werk | Spiegelt jeden Origin zurück und erlaubt Anmeldedaten; der Server warnt auf der Konsole, wenn zusätzlich kein Schlüssel gesetzt ist |
Es lauscht auf localhost, und das war immer so: Über die gesamte Geschichte des Repositoriums hinweg deklarieren von 719 Revisionen der Dateien, die den Host festlegen, 471 die 127.0.0.1 — und keine etwas anderes. Der Preis dieser Stille ist CORS: Der Server spiegelt jeden Origin zurück und erlaubt Anmeldedaten, sodass jede Webseite, die Sie besuchen, mit Ihrem laufenden llama-server sprechen kann. Er meldet das selbst auf der Konsole, wenn zusätzlich kein Schlüssel gesetzt ist. Es ist zugleich das einzige der fünf, das seine CORS-Politik danach anzieht, wie gefährlich das ist, was es freigibt: Schaltet man die Agentenwerkzeuge ein — die Dateien lesen, schreiben und bearbeiten und Befehle ausführen —, fällt es auf localhost-Ursprünge zurück. Von uns an der Primärquelle geprüft
«By default the server reflects any Origin header back with credentials allowed. […] CORS is set to allow all origins (‘*’) and no API key is set — this can be a security risk (cross-origin attacks).»
Quelle · abgerufen am 2026-08-25
Lässt es sich überprüfen?
Ja, und das ist der Grund, warum diese Zeile bei der Telemetrie ohne Erröten keine sagen kann. MIT, mit dem gesamten Motor, dem Server und der Weboberfläche in einem einzigen öffentlichen Repositorium. Es ist das einzige der fünf, von dem wir nach dem Lesen des Codes behaupten können, dass es weder Telemetrie sendet noch auf Updates prüft. Von uns an der Primärquelle geprüft
Quelle · abgerufen am 2026-08-25
Datenschutzerklärung
Es gibt keine Datenschutzerklärung, und das ist hier kein Mangel: Hinter dem Programm steht kein Dienst und kein Verantwortlicher, von dem man sie verlangen könnte. ungeprüft
Was es ausführt, und wo
Plattformen, Beschleuniger und Modellformate: die drei Wände, gegen die man am ersten Abend läuft, und die niemand aufschreibt, bevor er dagegen lief.
Wo es läuft
| Plattform | Unterstützung | Beleg |
|---|---|---|
| Windows | Ja: vorgebaute Binärdateien für x64 und ARM64, in den Varianten CPU, CUDA, Vulkan, ROCm, SYCL, OpenVINO und OpenCL/Adreno. Über winget installierbar. | von uns geprüft |
| macOS Apple Silicon | Ja: vorgebaute Binärdatei sowie Homebrew-, MacPorts- oder Nix-Paket. | von uns geprüft |
| macOS Intel | Ja, aber nur über die CPU. Es gibt eine Intel-Mac-Binärdatei, und der Veröffentlichungsablauf baut sie absichtlich mit abgeschaltetem Metal: Der Kommentar in ihrer eigenen Datei sagt, die Build-Maschinen hätten keine GPU. | von uns geprüft |
| Linux | Ja: x64, ARM64 und sogar s390x (IBM Z), in den Varianten CPU, Vulkan, ROCm, SYCL und OpenVINO. | von uns geprüft |
| + | Android ARM64 und ein xcframework für iOS/macOS. Außerdem sind RISC-V-Builds dokumentiert. | von uns geprüft |
Was es beschleunigt
| Backend | Status | Beleg |
|---|---|---|
| CUDA | Ja, aber die Binärdatei gibt es nur für Windows. Unter Linux muss man kompilieren oder Docker benutzen — womit der weltweit häufigste Fall, NVIDIA unter Linux, als einziger ohne fertigen Build dasteht. | von uns geprüft |
| ROCm | Ja, mit Binärdatei: ROCm 7.14, unter Windows und Linux. | von uns geprüft |
| Metal | Ja, in die macOS-ARM64-Binärdatei eingebaut. Auf Intel-Macs abgeschaltet. | von uns geprüft |
| Vulkan | Ja, mit Binärdatei: x64 und ARM64 unter Linux, x64 unter Windows. | von uns geprüft |
| CPU | Ja, mit SIMD je Architektur. Das ist der Daseinsgrund des Projekts. | von uns geprüft |
| SYCL / OpenCL / OpenVINO | Ja: SYCL für Intel, OpenCL/Adreno für Qualcomm-Handys und OpenVINO. | von uns geprüft |
| NPU | Konnten wir nicht überprüfen. Es veröffentlicht Binärdateien mit OpenVINO-Backend, Intels Stapel zur Beschleunigung auf CPU, GPU und NPU — aber keine offizielle Aussage sagt, dass llama.cpp auf der NPU rechnet, also behaupten wir es nicht. | ungeprüft |
Modellformate, die es ausführt
Nur GGUF. GGUF ist sein natives Format — dieses Projekt hat es erfunden. Safetensors müssen zuvor mit dem Skript umgewandelt werden, das das Repositorium selbst mitliefert. von uns geprüft
Quelle · abgerufen am 2026-08-25
Installieren und damit leben
Wie viele Schritte bis zum ersten Token, was es auf der Festplatte hinterlässt, unter welcher Lizenz und in welchem Tempo es sich ändert.
Schritte bis zum ersten Token
2 Schritte. Paket installieren und `llama serve -hf <Hugging-Face-Repo>` ausführen: Es lädt das Modell und öffnet die Weboberfläche. Was die Schwierigkeit erhöht, ist nicht die Installation, sondern dass alles über Kommandozeilenparameter eingestellt wird. von uns geprüft
Was es auf Ihre Festplatte schreibt
| Was | Wo | Beleg |
|---|---|---|
| Mit -hf heruntergeladene Modelle: der Standard-Cache von Hugging Face, geteilt mit allen anderen Programmen, die ihn benutzen — es wird also nichts doppelt geladen | ~/.cache/huggingface/hub — der Cache von Hugging Face (LLAMA_CACHE → HF_HUB_CACHE → HF_HOME/hub → XDG_CACHE_HOME) |
von uns geprüft |
| Weitere Artefakte und der Cache des RPC-Servers | $LLAMA_CACHE · $XDG_CACHE_HOME · ~/.cache/llama.cpp/ |
von uns geprüft |
| Gespräche der Weboberfläche: in Ihrem Browser, nicht auf dem Server | In Ihrem Browser, nicht auf dem Server: IndexedDB (Datenbank LlamaUi) und localStorage mit dem Präfix LlamaUi. Sie verschwinden beim Löschen der Websitedaten und gleichen sich nicht zwischen Browsern ab | von uns geprüft |
| Prompt-Cache: im Arbeitsspeicher, nicht auf der Platte, außer Sie verlangen es | Im Arbeitsspeicher, nicht auf der Platte (standardmäßig 8192 MiB). Auf die Platte kommt sie nur mit –slot-save-path oder –prompt-cache | von uns geprüft |
| Protokolle: nur wenn Sie sie anfordern | Nur mit –log-file; das Ablegen der Prompts auf der Platte (–log-prompts-dir) ist ausgeschaltet | von uns geprüft |
Lizenz
MIT. Der gesamte Motor, der Server und die Weboberfläche. von uns geprüft
Quelle · abgerufen am 2026-08-25
Version und Veröffentlichungstakt
Zwei Takte. Der Entwicklungskanal veröffentlicht rund acht Builds pro Tag (266 in 30 Tagen). Der stabile Kanal ist gerade erst entstanden, am 21. August 2026, und steht bei insgesamt vier Marken. von uns geprüft
«tag vX.Y.Z – stable, slower release cadence, recommended for downstream distribution and casual users; tag b[NUM] – bleeding edge, faster release cadence, recommended for developers and technical users.»
Quelle · abgerufen am 2026-08-25
Was Sie vor der Installation wissen sollten
- Es ist das einzige der fünf, von dem wir nach dem Lesen des Codes behaupten können, dass es keine Telemetrie sendet und nicht auf Updates prüft. Mit einer lokalen Modelldatei öffnet es keine einzige Verbindung.
- Seit dem 21. August 2026 gibt es einen stabilen Kanal (v0.2.0) neben den täglichen Builds. Jeder Text, der sagt „llama.cpp hat keine stabilen Versionen“, ist überholt. Achtung: Das winget-Paket liefert weiterhin den täglichen Build.
- Der Preis dieser Stille ist CORS: Der Server spiegelt jeden Ursprung und erlaubt Anmeldedaten, sodass jede besuchte Webseite mit Ihrem laufenden llama-server sprechen kann. Der Server warnt selbst auf der Konsole. Eingrenzen mit –cors-origins localhost.
- Der weltweit häufigste Fall — NVIDIA unter Linux — ist genau der ohne vorgebaute Binärdatei: kompilieren oder Docker.
- Sein Hilfsserver für verteiltes Rechnen trägt in der eigenen Dokumentation eine unmissverständliche Warnung: Das RPC-Backend ist ein Machbarkeitsnachweis, fragil und unsicher, und darf nie in einem offenen Netz laufen.