StartseiteProgrammellama.cpp

Programm-Datenblatt

llama.cpp

Aktuelle Version v0.2.0 (canal estable) / b10618 (compilacion diaria)2026-08-21 (v0.2.0) / 2026-08-25 (b10618)Geprüfter Stand master, commit eb25b7263e1604b4382295563f5a924002d6f87c (2026-08-25)Lizenz MIT

Für alle, die volle Kontrolle und die breiteste Hardware-Unterstützung wollen und denen das Terminal nichts ausmacht.

Der Motor. Es ist die C/C++-Implementierung, auf der fast alle anderen Consumer-Programme für lokale KI aufsetzen, und man kann sie direkt benutzen: ein Kommandozeilenwerkzeug und ein Server mit eigener Weboberfläche.

Auf einen Blick
Version und Veröffentlichungstaktv0.2.0 (canal estable) / b10618 (compilacion diaria)
Auf welcher Adresse es lauscht127.0.0.1:8080
Schritte bis zum ersten Token2 Schritte
Hosts, die es ab Werk kontaktiert4
LizenzMIT
2

Schritte bis zum ersten Token

Von Local AI Scope gemessen

4

Hosts, die es ab Werk kontaktiert

Von Local AI Scope gemessen

MIT

Lizenz

Von Local AI Scope gemessen

Methode

Wie wir das geprüft haben

Alles, was dieses Blatt über das Netz sagt, stammt aus dem Lesen des veröffentlichten Quellcodes und der offiziellen Dokumentation zum angegebenen Datum — nicht aus der Beobachtung des Datenverkehrs. Wir haben das Programm nicht mit einem Netzwerkanalysator laufen lassen: Das ist statische Analyse, keine Beobachtung. Eine echte Aufzeichnung steht noch aus; sobald es sie gibt, steigen diese Zellen eine Evidenzstufe. Das sagen wir lieber, als Sie annehmen zu lassen, wir hätten die Pakete mitgelesen.

Nach außen

Was Ihren Rechner verlässt

Die vier Fragen, die ein lokales Programm beantworten muss, bevor es Ihre Dokumente verdient: Was schickt es von sich aus hinaus, wen ruft es sonst noch, auf welcher Adresse hört es, und können Sie das selbst nachprüfen?

Telemetrie ab Werk

Überhaupt keine — und hier ist das eine Tatsache, kein Versprechen. Von uns an der Primärquelle geprüft

Wir haben den gesamten Baum beim Commit eb25b72 nach telemetry, analytics, posthog, mixpanel, sentry.io, google-analytics und gtag( in allen .c-, .cpp-, .h-, .hpp-, .ts-, .tsx-, .svelte- und .js-Dateien durchsucht: kein einziger echter Treffer. Die einzigen im Code stehenden Domains sind Dokumentations-URLs in Kommentaren. Es gibt keinen Endpunkt, an den Nutzungsdaten gingen. Es ist außerdem das einzige der fünf, das nicht auf Updates prüft: Mit einer lokalen Modelldatei öffnet es keine einzige Verbindung.

So schaltet man es ab: Nichts abzuschalten: Es gibt sie nicht.

Quelle · abgerufen am 2026-08-25

Andere Rufe nach Hause

Alle Aufrufe, die dieses Programm von sich aus macht: was, wohin, wann und ob man sie vermeiden kann
Was Wohin Wann Vermeidbar Beleg
Modell-Download huggingface.co Nur bei -hf, –model-url oder dem Download-Unterbefehl. Mit einer lokalen Datei öffnet es nichts. Es sendet allerdings eine User-Agent-Kennung des Builds. Lokale Dateien verwenden von uns geprüft
Download von Modellen, die als Container-Image verpackt sind auth.docker.io · registry-1.docker.io Nur mit der Option –docker-repo. Nicht benutzen von uns geprüft
Vorgebaute Weboberfläche, beim KOMPILIEREN huggingface.co Nur beim Bauen aus dem Quellcode mit der eingeschalteten Standardoption. Ohne Netz warnt es und baut ohne Oberfläche. LLAMA_USE_PREBUILT_UI=OFF von uns geprüft
Manuelle Selbstaktualisierung llama.app Nur wenn Sie den Update-Unterbefehl selbst ausführen, und nur bei Installationen über ihr Skript. Sie läuft nie von allein an. Nicht ausführen von uns geprüft

Quelle · abgerufen am 2026-08-25

Auf welcher Adresse es lauscht

Adresse, Authentifizierung und CORS-Regel, mit denen dieses Programm kommt
Einstellung Ab Werk
Lauscht auf 127.0.0.1:8080
Authentifizierung ab Werk keine
CORS ab Werk Spiegelt jeden Origin zurück und erlaubt Anmeldedaten; der Server warnt auf der Konsole, wenn zusätzlich kein Schlüssel gesetzt ist

Es lauscht auf localhost, und das war immer so: Über die gesamte Geschichte des Repositoriums hinweg deklarieren von 719 Revisionen der Dateien, die den Host festlegen, 471 die 127.0.0.1 — und keine etwas anderes. Der Preis dieser Stille ist CORS: Der Server spiegelt jeden Origin zurück und erlaubt Anmeldedaten, sodass jede Webseite, die Sie besuchen, mit Ihrem laufenden llama-server sprechen kann. Er meldet das selbst auf der Konsole, wenn zusätzlich kein Schlüssel gesetzt ist. Es ist zugleich das einzige der fünf, das seine CORS-Politik danach anzieht, wie gefährlich das ist, was es freigibt: Schaltet man die Agentenwerkzeuge ein — die Dateien lesen, schreiben und bearbeiten und Befehle ausführen —, fällt es auf localhost-Ursprünge zurück. Von uns an der Primärquelle geprüft

«By default the server reflects any Origin header back with credentials allowed. […] CORS is set to allow all origins (‘*’) and no API key is set — this can be a security risk (cross-origin attacks).»

Quelle · abgerufen am 2026-08-25

Lässt es sich überprüfen?

Ja, und das ist der Grund, warum diese Zeile bei der Telemetrie ohne Erröten keine sagen kann. MIT, mit dem gesamten Motor, dem Server und der Weboberfläche in einem einzigen öffentlichen Repositorium. Es ist das einzige der fünf, von dem wir nach dem Lesen des Codes behaupten können, dass es weder Telemetrie sendet noch auf Updates prüft. Von uns an der Primärquelle geprüft

Quelle · abgerufen am 2026-08-25

Datenschutzerklärung

Es gibt keine Datenschutzerklärung, und das ist hier kein Mangel: Hinter dem Programm steht kein Dienst und kein Verantwortlicher, von dem man sie verlangen könnte. ungeprüft

Abdeckung

Was es ausführt, und wo

Plattformen, Beschleuniger und Modellformate: die drei Wände, gegen die man am ersten Abend läuft, und die niemand aufschreibt, bevor er dagegen lief.

Wo es läuft

Plattformunterstützung, eine Zeile je Plattform
Plattform Unterstützung Beleg
Windows Ja: vorgebaute Binärdateien für x64 und ARM64, in den Varianten CPU, CUDA, Vulkan, ROCm, SYCL, OpenVINO und OpenCL/Adreno. Über winget installierbar. von uns geprüft
macOS Apple Silicon Ja: vorgebaute Binärdatei sowie Homebrew-, MacPorts- oder Nix-Paket. von uns geprüft
macOS Intel Ja, aber nur über die CPU. Es gibt eine Intel-Mac-Binärdatei, und der Veröffentlichungsablauf baut sie absichtlich mit abgeschaltetem Metal: Der Kommentar in ihrer eigenen Datei sagt, die Build-Maschinen hätten keine GPU. von uns geprüft
Linux Ja: x64, ARM64 und sogar s390x (IBM Z), in den Varianten CPU, Vulkan, ROCm, SYCL und OpenVINO. von uns geprüft
+ Android ARM64 und ein xcframework für iOS/macOS. Außerdem sind RISC-V-Builds dokumentiert. von uns geprüft

Was es beschleunigt

Hardware-Beschleuniger und ihr Stand
Backend Status Beleg
CUDA Ja, aber die Binärdatei gibt es nur für Windows. Unter Linux muss man kompilieren oder Docker benutzen — womit der weltweit häufigste Fall, NVIDIA unter Linux, als einziger ohne fertigen Build dasteht. von uns geprüft
ROCm Ja, mit Binärdatei: ROCm 7.14, unter Windows und Linux. von uns geprüft
Metal Ja, in die macOS-ARM64-Binärdatei eingebaut. Auf Intel-Macs abgeschaltet. von uns geprüft
Vulkan Ja, mit Binärdatei: x64 und ARM64 unter Linux, x64 unter Windows. von uns geprüft
CPU Ja, mit SIMD je Architektur. Das ist der Daseinsgrund des Projekts. von uns geprüft
SYCL / OpenCL / OpenVINO Ja: SYCL für Intel, OpenCL/Adreno für Qualcomm-Handys und OpenVINO. von uns geprüft
NPU Konnten wir nicht überprüfen. Es veröffentlicht Binärdateien mit OpenVINO-Backend, Intels Stapel zur Beschleunigung auf CPU, GPU und NPU — aber keine offizielle Aussage sagt, dass llama.cpp auf der NPU rechnet, also behaupten wir es nicht. ungeprüft

Modellformate, die es ausführt

Nur GGUF. GGUF ist sein natives Format — dieses Projekt hat es erfunden. Safetensors müssen zuvor mit dem Skript umgewandelt werden, das das Repositorium selbst mitliefert. von uns geprüft

Quelle · abgerufen am 2026-08-25

Im Alltag

Installieren und damit leben

Wie viele Schritte bis zum ersten Token, was es auf der Festplatte hinterlässt, unter welcher Lizenz und in welchem Tempo es sich ändert.

Schritte bis zum ersten Token

2 Schritte. Paket installieren und `llama serve -hf <Hugging-Face-Repo>` ausführen: Es lädt das Modell und öffnet die Weboberfläche. Was die Schwierigkeit erhöht, ist nicht die Installation, sondern dass alles über Kommandozeilenparameter eingestellt wird. von uns geprüft

Was es auf Ihre Festplatte schreibt

Was dieses Programm auf Ihre Festplatte schreibt und wohin
Was Wo Beleg
Mit -hf heruntergeladene Modelle: der Standard-Cache von Hugging Face, geteilt mit allen anderen Programmen, die ihn benutzen — es wird also nichts doppelt geladen ~/.cache/huggingface/hub — der Cache von Hugging Face (LLAMA_CACHE → HF_HUB_CACHE → HF_HOME/hub → XDG_CACHE_HOME) von uns geprüft
Weitere Artefakte und der Cache des RPC-Servers $LLAMA_CACHE · $XDG_CACHE_HOME · ~/.cache/llama.cpp/ von uns geprüft
Gespräche der Weboberfläche: in Ihrem Browser, nicht auf dem Server In Ihrem Browser, nicht auf dem Server: IndexedDB (Datenbank LlamaUi) und localStorage mit dem Präfix LlamaUi. Sie verschwinden beim Löschen der Websitedaten und gleichen sich nicht zwischen Browsern ab von uns geprüft
Prompt-Cache: im Arbeitsspeicher, nicht auf der Platte, außer Sie verlangen es Im Arbeitsspeicher, nicht auf der Platte (standardmäßig 8192 MiB). Auf die Platte kommt sie nur mit –slot-save-path oder –prompt-cache von uns geprüft
Protokolle: nur wenn Sie sie anfordern Nur mit –log-file; das Ablegen der Prompts auf der Platte (–log-prompts-dir) ist ausgeschaltet von uns geprüft

Lizenz

MIT. Der gesamte Motor, der Server und die Weboberfläche. von uns geprüft

Quelle · abgerufen am 2026-08-25

Version und Veröffentlichungstakt

Zwei Takte. Der Entwicklungskanal veröffentlicht rund acht Builds pro Tag (266 in 30 Tagen). Der stabile Kanal ist gerade erst entstanden, am 21. August 2026, und steht bei insgesamt vier Marken. von uns geprüft

«tag vX.Y.Z – stable, slower release cadence, recommended for downstream distribution and casual users; tag b[NUM] – bleeding edge, faster release cadence, recommended for developers and technical users.»

Quelle · abgerufen am 2026-08-25

Hinweise

Was Sie vor der Installation wissen sollten

  • Es ist das einzige der fünf, von dem wir nach dem Lesen des Codes behaupten können, dass es keine Telemetrie sendet und nicht auf Updates prüft. Mit einer lokalen Modelldatei öffnet es keine einzige Verbindung.
  • Seit dem 21. August 2026 gibt es einen stabilen Kanal (v0.2.0) neben den täglichen Builds. Jeder Text, der sagt „llama.cpp hat keine stabilen Versionen“, ist überholt. Achtung: Das winget-Paket liefert weiterhin den täglichen Build.
  • Der Preis dieser Stille ist CORS: Der Server spiegelt jeden Ursprung und erlaubt Anmeldedaten, sodass jede besuchte Webseite mit Ihrem laufenden llama-server sprechen kann. Der Server warnt selbst auf der Konsole. Eingrenzen mit –cors-origins localhost.
  • Der weltweit häufigste Fall — NVIDIA unter Linux — ist genau der ohne vorgebaute Binärdatei: kompilieren oder Docker.
  • Sein Hilfsserver für verteiltes Rechnen trägt in der eigenen Dokumentation eine unmissverständliche Warnung: Das RPC-Backend ist ein Machbarkeitsnachweis, fragil und unsicher, und darf nie in einem offenen Netz laufen.