StartseiteProgrammevLLM

Programm-Datenblatt

vLLM

Aktuelle Version 0.27.12026-08-11Geprüfter Stand tag v0.27.1 (2026-08-11) y rama principal del 2026-08-25Lizenz Apache-2.0

Für alle, die einen Dienst aufbauen, nicht für die, die ein Modell auf dem eigenen Rechner wollen. Es steht hier als Markierung des professionellen Endes.

Inferenzmotor, gebaut, um Modelle vielen Menschen gleichzeitig bereitzustellen, nicht zum Chatten auf einem Notebook. Auf Servern mit NVIDIA-GPUs ist er der De-facto-Standard.

Auf einen Blick
Version und Veröffentlichungstakt0.27.1
Auf welcher Adresse es lauscht0.0.0.0:8000
Schritte bis zum ersten Token2 Schritte
Hosts, die es ab Werk kontaktiert3
LizenzApache-2.0
2

Schritte bis zum ersten Token

Von Local AI Scope gemessen

3

Hosts, die es ab Werk kontaktiert

Von Local AI Scope gemessen

Apache-2.0

Lizenz

Von Local AI Scope gemessen

Methode

Wie wir das geprüft haben

Alles, was dieses Blatt über das Netz sagt, stammt aus dem Lesen des veröffentlichten Quellcodes und der offiziellen Dokumentation zum angegebenen Datum — nicht aus der Beobachtung des Datenverkehrs. Wir haben das Programm nicht mit einem Netzwerkanalysator laufen lassen: Das ist statische Analyse, keine Beobachtung. Eine echte Aufzeichnung steht noch aus; sobald es sie gibt, steigen diese Zellen eine Evidenzstufe. Das sagen wir lieber, als Sie annehmen zu lassen, wir hätten die Pakete mitgelesen.

Nach außen

Was Ihren Rechner verlässt

Die vier Fragen, die ein lokales Programm beantworten muss, bevor es Ihre Dokumente verdient: Was schickt es von sich aus hinaus, wen ruft es sonst noch, auf welcher Adresse hört es, und können Sie das selbst nachprüfen?

Telemetrie ab Werk

Ja, ab Werk eingeschaltet — und es ist kein Hinweis beim Start, es ist ein Herzschlag alle zehn Minuten. Von uns an der Primärquelle geprüft

Dass vLLM standardmäßig Nutzungsstatistiken erhebt, ist dokumentiert. Was nicht in der Dokumentation steht und erst beim Lesen des Codes auftaucht: Es ist kein einmaliges Senden. Die Funktion für die fortlaufende Meldung führt eine Endlosschleife aus, die 600 Sekunden schläft und erneut POSTet, solange der Prozess lebt. Auch das Ziel steht nicht in der Dokumentation: Für stats.vllm.ai muss man in den Code. Netzwerkfehler werden stillschweigend verschluckt. Was hinausgeht: eine zufällige Kennung des Laufs, der aus Hardware-Kennungen erkannte Cloud-Anbieter, Kernzahl, Prozessormarke und Familie/Modell/Stepping, Gesamtspeicher, die vollständige Betriebssystem-Zeichenkette, CUDA-Version, Anzahl der GPUs mit Modell und Speicher je Gerät, fünf Umgebungsvariablen, die Architektur des geladenen Modells und — auf dem Serverpfad — weitere gut zwanzig Startparameter. Zu seinen Gunsten, und das muss gesagt werden: Es ist das einzige der fünf, das Sie genau sehen lässt, was es sendet, in ~/.config/vllm/usage_stats.json, und es bietet vier Wege, es abzuschalten.

«Report usage every 10 minutes. This helps us to collect more data points for uptime of vLLM usages.»

So schaltet man es ab: Eine dieser vier: VLLM_NO_USAGE_STATS=1, DO_NOT_TRACK=1, VLLM_DO_NOT_TRACK=1 oder das Anlegen der Datei ~/.config/vllm/do_not_track. Die Dokumentation veröffentlicht die ersten drei; die vierte steht nur im Code.

Quelle · abgerufen am 2026-08-25

Andere Rufe nach Hause

Alle Aufrufe, die dieses Programm von sich aus macht: was, wohin, wann und ob man sie vermeiden kann
Was Wohin Wann Vermeidbar Beleg
Nutzungsstatistiken stats.vllm.ai Beim Start und alle 10 Minuten, immer, außer Sie schalten es ab. Ja, auf vier verschiedenen Wegen von uns geprüft
Modell-Download, mit Selbstidentifikation als vLLM huggingface.co (oder modelscope) Beim Laden eines Modells, das nicht im Cache liegt. Es ist das einzige der fünf, das Hugging Face mitteilt, welche Laufzeitumgebung und welche Version herunterlädt. HF_HUB_OFFLINE=1 von uns geprüft
Prometheus-Metrik-Endpunkt: lokal, es verlässt nichts Ihren Rechner lokal — nichts verlässt den Rechner Immer: /metrics ist standardmäßig eingehängt. Da er nicht unter /v1 liegt, deckt ihn der API-Schlüssel nicht ab. Nicht dokumentiert von uns geprüft

Quelle · abgerufen am 2026-08-25

Auf welcher Adresse es lauscht

Adresse, Authentifizierung und CORS-Regel, mit denen dieses Programm kommt
Einstellung Ab Werk
Lauscht auf 0.0.0.0:8000
Authentifizierung ab Werk keine
CORS ab Werk Sperrangelweit offen: jeder Ursprung, jede Methode, jeder Kopf

Das ist die entscheidende Zeile. In der veröffentlichten Version hat der Host-Parameter keinen Wert und löst sich in die leere Zeichenkette auf, und eine Bindung an die leere Zeichenkette über IPv4 ist INADDR_ANY, also 0.0.0.0. Ein `vllm serve Modell` ohne weitere Parameter stellt das Modell dem gesamten lokalen Netz zur Verfügung, ohne Passwort. Wir haben denselben Standardwert in acht Versionen geprüft: Das ist keine neue Regression. Und es gibt ein zweites Stockwerk: Die eigene Sicherheitsseite räumt ein, dass der API-Schlüssel nicht reicht, weil er nur die Präfixe /v1, /v2 und /inference abdeckt, während andere sensible Endpunkte auf demselben Server ohne Authentifizierung bleiben. Die Empfehlung lautet, ihn hinter einen Reverse Proxy zu stellen. Ein drittes Detail: Die Kommunikationsschicht von PyTorch öffnet einen Speicher, der selbst auf einem einzelnen Rechner auf allen Schnittstellen lauscht — und das Projekt selbst nennt das standardmäßig unsicher. Von uns an der Primärquelle geprüft

«The –api-key flag (or VLLM_API_KEY environment variable) provides authentication for vLLM’s HTTP server, but only for OpenAI-compatible API endpoints under the /v1 path prefix […]. Many other sensitive endpoints are exposed on the same HTTP server without any authentication enforcement.»

Quelle · abgerufen am 2026-08-25

Lässt es sich überprüfen?

Ja. Apache-2.0, das einzige der fünf, das weder MIT noch proprietär ist. Alles, was dieses Blatt über den Zehn-Minuten-Herzschlag und über 0.0.0.0 sagt, wurde im Code der veröffentlichten Marke gelesen, nicht aus der Dokumentation geschlossen — die in beiden Fällen weniger vollständig ist und in einem davon das Gegenteil sagt. Von uns an der Primärquelle geprüft

Quelle · abgerufen am 2026-08-25

Datenschutzerklärung

Eine Datenschutzerklärung im üblichen Sinn gibt es nicht: Es gibt eine Dokumentationsseite, die erklärt, was erhoben wird und wie man es abschaltet, und die ankündigt, eine bereinigte, aggregierte Teilmenge zum Nutzen der Gemeinschaft zu veröffentlichen. Herstellerangabe Quelle

Abdeckung

Was es ausführt, und wo

Plattformen, Beschleuniger und Modellformate: die drei Wände, gegen die man am ersten Abend läuft, und die niemand aufschreibt, bevor er dagegen lief.

Wo es läuft

Plattformunterstützung, eine Zeile je Plattform
Plattform Unterstützung Beleg
Windows Keine native Unterstützung. Der offizielle Weg ist WSL. Herstellerangabe
macOS Apple Silicon Experimentell und nur über die CPU: Die Dokumentation sagt, man müsse aus dem Quellcode bauen. Die GPU läuft nicht über vLLM, sondern über ein Community-Plugin, das darunter MLX benutzt und Modelle im MLX-Format verlangt. Herstellerangabe
macOS Intel Konnten wir nicht überprüfen. Es gibt weder Wheels noch Dokumentation für Intel-Macs; der Apple-Silicon-Abschnitt ist der einzige macOS-Abschnitt, und seine Wheels sind arm64. Wir melden die Abwesenheit, kein „nein“. ungeprüft
Linux Ja, das ist seine Plattform. Python 3.10 bis 3.13 laut Dokumentation. Herstellerangabe

Was es beschleunigt

Hardware-Beschleuniger und ihr Stand
Backend Status Beleg
CUDA Ja, und das ist der erstklassige Fall: der einzige, den die eigene Website als beliebt kennzeichnet. Verlangt Compute Capability 7.5 oder höher, was GTX 10xx und älter ausschließt. Herstellerangabe
ROCm Ja, mit eigenem Paketindex, aber enger als CUDA: Python 3.12 und ROCm 7.0. Herstellerangabe
CPU Ja, mit Einschränkungen: x86 (AVX512 empfohlen, mit AVX2 nur eingeschränkte Funktionen), ARM mit NEON und IBM Z. Herstellerangabe
Metal Nein, nur über ein externes Plugin: vLLM-Metal, von der Community gepflegt, das darunter MLX benutzt. Herstellerangabe
NPU / Beschleuniger Nicht im Hauptrepositorium. Google TPU, Intel Gaudi, AWS Neuron und Ascend sind seit 0.27 eigene Pakete. Herstellerangabe
Vulkan Konnten wir nicht überprüfen. Es steht nicht auf ihrer Seite der unterstützten Plattformen, und es gibt keine Aussage in irgendeine Richtung. ungeprüft

Modellformate, die es ausführt

safetensors nativ, dazu AWQ, GPTQ, FP8, compressed-tensors, bitsandbytes und gut zwanzig weitere Quantisierungsverfahren. GGUF ist nicht mehr enthalten: Seit 0.27 wurde es in ein eigenes Plugin ausgelagert, und sie selbst nennen es weiterhin hochgradig experimentell. Jeder Text, der ohne diese Einschränkung sagt „vLLM unterstützt GGUF“, ist überholt. von uns geprüft

Quelle · abgerufen am 2026-08-25

Im Alltag

Installieren und damit leben

Wie viele Schritte bis zum ersten Token, was es auf der Festplatte hinterlässt, unter welcher Lizenz und in welchem Tempo es sich ändert.

Schritte bis zum ersten Token

2 Schritte. Paket installieren und `vllm serve <Modell>` ausführen. Es gibt keine Oberfläche: Man spricht über die API mit ihm. Die Schwierigkeit liegt nicht im Installieren, sondern darin, dass es nichts zu sehen gibt und man die Speicherparameter verstehen muss. von uns geprüft

Was es auf Ihre Festplatte schreibt

Was dieses Programm auf Ihre Festplatte schreibt und wohin
Was Wo Beleg
Eine lokale Kopie der gesendeten Telemetrie: Die Dokumentation lädt ausdrücklich zum Nachlesen ein, und es ist das einzige der fünf, das Ihnen genau zeigt, was hinausgeht ~/.config/vllm/usage_stats.json von uns geprüft
Wächterdatei zum Abschalten der Telemetrie: Sie legen sie selbst an ~/.config/vllm/do_not_track — Sie legen sie an von uns geprüft
Kompilierungs-Cache von PyTorch ~/.cache/vllm (VLLM_CACHE_ROOT) Herstellerangabe
Modelle: der Cache von Hugging Face ~/.cache/huggingface — der Cache von Hugging Face (HF_HOME) Herstellerangabe
Gesprächsverlauf: gibt es nicht. Es ist ein API-Server ohne Chat-Oberfläche und speichert nichts aus den Anfragen Nirgends — es wird nichts geschrieben von uns geprüft

Lizenz

Apache-2.0. Das einzige der fünf, das weder MIT noch proprietär ist. von uns geprüft

Quelle · abgerufen am 2026-08-25

Version und Veröffentlichungstakt

Etwa alle zwei Wochen eine Nebenversion, mit Korrekturen in ein bis drei Tagen. Nicht monatlich: Die letzten Nebensprünge lagen 14, 12, 16 und 14 Tage auseinander. Achtung beim Datieren jedes Textes darüber: Die Marke v0.28.0 existiert seit dem 23. August 2026 ohne Veröffentlichung, 0.28 kann also jeden Tag erscheinen. von uns geprüft

Quelle · abgerufen am 2026-08-25

Hinweise

Was Sie vor der Installation wissen sollten

  • Es ist das einzige der fünf mit ab Werk eingeschalteter Telemetrie, und es ist kein Hinweis beim Start: Es sendet einen Herzschlag alle zehn Minuten, solange der Server lebt. Zu seinen Gunsten: Es dokumentiert das, lässt den genauen Inhalt in einer lokalen Datei lesen und bietet vier Wege, es abzuschalten.
  • Es ist außerdem das einzige, das standardmäßig auf 0.0.0.0 und ohne Schlüssel lauscht. Ein `vllm serve Modell` ohne weitere Parameter, auf einem Notebook im Hotel-WLAN, stellt das Modell dem gesamten Netz zur Verfügung. Keine Regression: So ist es seit mindestens acht Versionen.
  • Die eigene Sicherheitsseite warnt, dass der API-Schlüssel nur die Routen /v1, /v2 und /inference abdeckt und dass es auf demselben Server sensible Endpunkte ohne Authentifizierung gibt. Die offizielle Empfehlung lautet: hinter einen Reverse Proxy.
  • Es reserviert 92 % des Kartenspeichers direkt beim Start, und zwar als Vorabreservierung, nicht als Nutzung auf Abruf. Vorsicht mit der Zahl: Die im Netz kursierenden 90 % stammen aus einem seit Version 0.4.0 eingefrorenen Beispiel in ihrer eigenen Dokumentation.
  • vLLM veröffentlicht nirgends eine Mindestangabe für Grafikspeicher. Die einzige veröffentlichte Hardware-Anforderung ist Compute Capability 7.5. Wir erfinden keine Zahl.
  • Es ist kein Programm für Ihren Rechner. Keine Oberfläche, kein natives Windows, und auf dem Mac nur ein experimentelles CPU-Backend. Es steht in diesem Vergleich, um die Grenze zu markieren.