Startseite›Programme›vLLM
vLLM
Aktuelle Version 0.27.12026-08-11Geprüfter Stand tag v0.27.1 (2026-08-11) y rama principal del 2026-08-25Lizenz Apache-2.0
Für alle, die einen Dienst aufbauen, nicht für die, die ein Modell auf dem eigenen Rechner wollen. Es steht hier als Markierung des professionellen Endes.
Inferenzmotor, gebaut, um Modelle vielen Menschen gleichzeitig bereitzustellen, nicht zum Chatten auf einem Notebook. Auf Servern mit NVIDIA-GPUs ist er der De-facto-Standard.
Schritte bis zum ersten Token
Von Local AI Scope gemessen
Hosts, die es ab Werk kontaktiert
Von Local AI Scope gemessen
Lizenz
Von Local AI Scope gemessen
Wie wir das geprüft haben
Alles, was dieses Blatt über das Netz sagt, stammt aus dem Lesen des veröffentlichten Quellcodes und der offiziellen Dokumentation zum angegebenen Datum — nicht aus der Beobachtung des Datenverkehrs. Wir haben das Programm nicht mit einem Netzwerkanalysator laufen lassen: Das ist statische Analyse, keine Beobachtung. Eine echte Aufzeichnung steht noch aus; sobald es sie gibt, steigen diese Zellen eine Evidenzstufe. Das sagen wir lieber, als Sie annehmen zu lassen, wir hätten die Pakete mitgelesen.
Was Ihren Rechner verlässt
Die vier Fragen, die ein lokales Programm beantworten muss, bevor es Ihre Dokumente verdient: Was schickt es von sich aus hinaus, wen ruft es sonst noch, auf welcher Adresse hört es, und können Sie das selbst nachprüfen?
Telemetrie ab Werk
Ja, ab Werk eingeschaltet — und es ist kein Hinweis beim Start, es ist ein Herzschlag alle zehn Minuten. Von uns an der Primärquelle geprüft
Dass vLLM standardmäßig Nutzungsstatistiken erhebt, ist dokumentiert. Was nicht in der Dokumentation steht und erst beim Lesen des Codes auftaucht: Es ist kein einmaliges Senden. Die Funktion für die fortlaufende Meldung führt eine Endlosschleife aus, die 600 Sekunden schläft und erneut POSTet, solange der Prozess lebt. Auch das Ziel steht nicht in der Dokumentation: Für stats.vllm.ai muss man in den Code. Netzwerkfehler werden stillschweigend verschluckt. Was hinausgeht: eine zufällige Kennung des Laufs, der aus Hardware-Kennungen erkannte Cloud-Anbieter, Kernzahl, Prozessormarke und Familie/Modell/Stepping, Gesamtspeicher, die vollständige Betriebssystem-Zeichenkette, CUDA-Version, Anzahl der GPUs mit Modell und Speicher je Gerät, fünf Umgebungsvariablen, die Architektur des geladenen Modells und — auf dem Serverpfad — weitere gut zwanzig Startparameter. Zu seinen Gunsten, und das muss gesagt werden: Es ist das einzige der fünf, das Sie genau sehen lässt, was es sendet, in ~/.config/vllm/usage_stats.json, und es bietet vier Wege, es abzuschalten.
«Report usage every 10 minutes. This helps us to collect more data points for uptime of vLLM usages.»
So schaltet man es ab: Eine dieser vier: VLLM_NO_USAGE_STATS=1, DO_NOT_TRACK=1, VLLM_DO_NOT_TRACK=1 oder das Anlegen der Datei ~/.config/vllm/do_not_track. Die Dokumentation veröffentlicht die ersten drei; die vierte steht nur im Code.
Quelle · abgerufen am 2026-08-25
Andere Rufe nach Hause
| Was | Wohin | Wann | Vermeidbar | Beleg |
|---|---|---|---|---|
| Nutzungsstatistiken | stats.vllm.ai |
Beim Start und alle 10 Minuten, immer, außer Sie schalten es ab. | Ja, auf vier verschiedenen Wegen | von uns geprüft |
| Modell-Download, mit Selbstidentifikation als vLLM | huggingface.co (oder modelscope) |
Beim Laden eines Modells, das nicht im Cache liegt. Es ist das einzige der fünf, das Hugging Face mitteilt, welche Laufzeitumgebung und welche Version herunterlädt. | HF_HUB_OFFLINE=1 | von uns geprüft |
| Prometheus-Metrik-Endpunkt: lokal, es verlässt nichts Ihren Rechner | lokal — nichts verlässt den Rechner |
Immer: /metrics ist standardmäßig eingehängt. Da er nicht unter /v1 liegt, deckt ihn der API-Schlüssel nicht ab. | Nicht dokumentiert | von uns geprüft |
Quelle · abgerufen am 2026-08-25
Auf welcher Adresse es lauscht
| Einstellung | Ab Werk |
|---|---|
| Lauscht auf | 0.0.0.0:8000 |
| Authentifizierung ab Werk | keine |
| CORS ab Werk | Sperrangelweit offen: jeder Ursprung, jede Methode, jeder Kopf |
Das ist die entscheidende Zeile. In der veröffentlichten Version hat der Host-Parameter keinen Wert und löst sich in die leere Zeichenkette auf, und eine Bindung an die leere Zeichenkette über IPv4 ist INADDR_ANY, also 0.0.0.0. Ein `vllm serve Modell` ohne weitere Parameter stellt das Modell dem gesamten lokalen Netz zur Verfügung, ohne Passwort. Wir haben denselben Standardwert in acht Versionen geprüft: Das ist keine neue Regression. Und es gibt ein zweites Stockwerk: Die eigene Sicherheitsseite räumt ein, dass der API-Schlüssel nicht reicht, weil er nur die Präfixe /v1, /v2 und /inference abdeckt, während andere sensible Endpunkte auf demselben Server ohne Authentifizierung bleiben. Die Empfehlung lautet, ihn hinter einen Reverse Proxy zu stellen. Ein drittes Detail: Die Kommunikationsschicht von PyTorch öffnet einen Speicher, der selbst auf einem einzelnen Rechner auf allen Schnittstellen lauscht — und das Projekt selbst nennt das standardmäßig unsicher. Von uns an der Primärquelle geprüft
«The –api-key flag (or VLLM_API_KEY environment variable) provides authentication for vLLM’s HTTP server, but only for OpenAI-compatible API endpoints under the /v1 path prefix […]. Many other sensitive endpoints are exposed on the same HTTP server without any authentication enforcement.»
Quelle · abgerufen am 2026-08-25
Lässt es sich überprüfen?
Ja. Apache-2.0, das einzige der fünf, das weder MIT noch proprietär ist. Alles, was dieses Blatt über den Zehn-Minuten-Herzschlag und über 0.0.0.0 sagt, wurde im Code der veröffentlichten Marke gelesen, nicht aus der Dokumentation geschlossen — die in beiden Fällen weniger vollständig ist und in einem davon das Gegenteil sagt. Von uns an der Primärquelle geprüft
Quelle · abgerufen am 2026-08-25
Datenschutzerklärung
Eine Datenschutzerklärung im üblichen Sinn gibt es nicht: Es gibt eine Dokumentationsseite, die erklärt, was erhoben wird und wie man es abschaltet, und die ankündigt, eine bereinigte, aggregierte Teilmenge zum Nutzen der Gemeinschaft zu veröffentlichen. Herstellerangabe Quelle
Was es ausführt, und wo
Plattformen, Beschleuniger und Modellformate: die drei Wände, gegen die man am ersten Abend läuft, und die niemand aufschreibt, bevor er dagegen lief.
Wo es läuft
| Plattform | Unterstützung | Beleg |
|---|---|---|
| Windows | Keine native Unterstützung. Der offizielle Weg ist WSL. | Herstellerangabe |
| macOS Apple Silicon | Experimentell und nur über die CPU: Die Dokumentation sagt, man müsse aus dem Quellcode bauen. Die GPU läuft nicht über vLLM, sondern über ein Community-Plugin, das darunter MLX benutzt und Modelle im MLX-Format verlangt. | Herstellerangabe |
| macOS Intel | Konnten wir nicht überprüfen. Es gibt weder Wheels noch Dokumentation für Intel-Macs; der Apple-Silicon-Abschnitt ist der einzige macOS-Abschnitt, und seine Wheels sind arm64. Wir melden die Abwesenheit, kein „nein“. | ungeprüft |
| Linux | Ja, das ist seine Plattform. Python 3.10 bis 3.13 laut Dokumentation. | Herstellerangabe |
Was es beschleunigt
| Backend | Status | Beleg |
|---|---|---|
| CUDA | Ja, und das ist der erstklassige Fall: der einzige, den die eigene Website als beliebt kennzeichnet. Verlangt Compute Capability 7.5 oder höher, was GTX 10xx und älter ausschließt. | Herstellerangabe |
| ROCm | Ja, mit eigenem Paketindex, aber enger als CUDA: Python 3.12 und ROCm 7.0. | Herstellerangabe |
| CPU | Ja, mit Einschränkungen: x86 (AVX512 empfohlen, mit AVX2 nur eingeschränkte Funktionen), ARM mit NEON und IBM Z. | Herstellerangabe |
| Metal | Nein, nur über ein externes Plugin: vLLM-Metal, von der Community gepflegt, das darunter MLX benutzt. | Herstellerangabe |
| NPU / Beschleuniger | Nicht im Hauptrepositorium. Google TPU, Intel Gaudi, AWS Neuron und Ascend sind seit 0.27 eigene Pakete. | Herstellerangabe |
| Vulkan | Konnten wir nicht überprüfen. Es steht nicht auf ihrer Seite der unterstützten Plattformen, und es gibt keine Aussage in irgendeine Richtung. | ungeprüft |
Modellformate, die es ausführt
safetensors nativ, dazu AWQ, GPTQ, FP8, compressed-tensors, bitsandbytes und gut zwanzig weitere Quantisierungsverfahren. GGUF ist nicht mehr enthalten: Seit 0.27 wurde es in ein eigenes Plugin ausgelagert, und sie selbst nennen es weiterhin hochgradig experimentell. Jeder Text, der ohne diese Einschränkung sagt „vLLM unterstützt GGUF“, ist überholt. von uns geprüft
Quelle · abgerufen am 2026-08-25
Installieren und damit leben
Wie viele Schritte bis zum ersten Token, was es auf der Festplatte hinterlässt, unter welcher Lizenz und in welchem Tempo es sich ändert.
Schritte bis zum ersten Token
2 Schritte. Paket installieren und `vllm serve <Modell>` ausführen. Es gibt keine Oberfläche: Man spricht über die API mit ihm. Die Schwierigkeit liegt nicht im Installieren, sondern darin, dass es nichts zu sehen gibt und man die Speicherparameter verstehen muss. von uns geprüft
Was es auf Ihre Festplatte schreibt
| Was | Wo | Beleg |
|---|---|---|
| Eine lokale Kopie der gesendeten Telemetrie: Die Dokumentation lädt ausdrücklich zum Nachlesen ein, und es ist das einzige der fünf, das Ihnen genau zeigt, was hinausgeht | ~/.config/vllm/usage_stats.json |
von uns geprüft |
| Wächterdatei zum Abschalten der Telemetrie: Sie legen sie selbst an | ~/.config/vllm/do_not_track — Sie legen sie an |
von uns geprüft |
| Kompilierungs-Cache von PyTorch | ~/.cache/vllm (VLLM_CACHE_ROOT) |
Herstellerangabe |
| Modelle: der Cache von Hugging Face | ~/.cache/huggingface — der Cache von Hugging Face (HF_HOME) |
Herstellerangabe |
| Gesprächsverlauf: gibt es nicht. Es ist ein API-Server ohne Chat-Oberfläche und speichert nichts aus den Anfragen | Nirgends — es wird nichts geschrieben | von uns geprüft |
Lizenz
Apache-2.0. Das einzige der fünf, das weder MIT noch proprietär ist. von uns geprüft
Quelle · abgerufen am 2026-08-25
Version und Veröffentlichungstakt
Etwa alle zwei Wochen eine Nebenversion, mit Korrekturen in ein bis drei Tagen. Nicht monatlich: Die letzten Nebensprünge lagen 14, 12, 16 und 14 Tage auseinander. Achtung beim Datieren jedes Textes darüber: Die Marke v0.28.0 existiert seit dem 23. August 2026 ohne Veröffentlichung, 0.28 kann also jeden Tag erscheinen. von uns geprüft
Quelle · abgerufen am 2026-08-25
Was Sie vor der Installation wissen sollten
- Es ist das einzige der fünf mit ab Werk eingeschalteter Telemetrie, und es ist kein Hinweis beim Start: Es sendet einen Herzschlag alle zehn Minuten, solange der Server lebt. Zu seinen Gunsten: Es dokumentiert das, lässt den genauen Inhalt in einer lokalen Datei lesen und bietet vier Wege, es abzuschalten.
- Es ist außerdem das einzige, das standardmäßig auf 0.0.0.0 und ohne Schlüssel lauscht. Ein `vllm serve Modell` ohne weitere Parameter, auf einem Notebook im Hotel-WLAN, stellt das Modell dem gesamten Netz zur Verfügung. Keine Regression: So ist es seit mindestens acht Versionen.
- Die eigene Sicherheitsseite warnt, dass der API-Schlüssel nur die Routen /v1, /v2 und /inference abdeckt und dass es auf demselben Server sensible Endpunkte ohne Authentifizierung gibt. Die offizielle Empfehlung lautet: hinter einen Reverse Proxy.
- Es reserviert 92 % des Kartenspeichers direkt beim Start, und zwar als Vorabreservierung, nicht als Nutzung auf Abruf. Vorsicht mit der Zahl: Die im Netz kursierenden 90 % stammen aus einem seit Version 0.4.0 eingefrorenen Beispiel in ihrer eigenen Dokumentation.
- vLLM veröffentlicht nirgends eine Mindestangabe für Grafikspeicher. Die einzige veröffentlichte Hardware-Anforderung ist Compute Capability 7.5. Wir erfinden keine Zahl.
- Es ist kein Programm für Ihren Rechner. Keine Oberfläche, kein natives Windows, und auf dem Mac nur ein experimentelles CPU-Backend. Es steht in diesem Vergleich, um die Grenze zu markieren.