AccueilLogicielsvLLM

Fiche de logiciel

vLLM

Version en vigueur 0.27.12026-08-11Arbre audité tag v0.27.1 (2026-08-11) y rama principal del 2026-08-25Licence Apache-2.0

Pour qui monte un service, pas pour qui veut un modèle sur son ordinateur. Il figure ici comme repère de l’extrémité professionnelle.

Moteur d’inférence conçu pour servir des modèles à beaucoup de monde à la fois, pas pour discuter sur un portable. C’est le standard de fait sur les serveurs à GPU NVIDIA.

En un coup d’œil
Version et rythme de publication0.27.1
Sur quelle adresse il écoute0.0.0.0:8000
Étapes jusqu’au premier token2 étapes
Hôtes qu’il contacte d’origine3
LicenceApache-2.0
2

Étapes jusqu’au premier token

Mesuré par Local AI Scope

3

Hôtes qu’il contacte d’origine

Mesuré par Local AI Scope

Apache-2.0

Licence

Mesuré par Local AI Scope

Méthode

Comment nous l’avons vérifié

Tout ce que cette fiche affirme sur le réseau vient de la lecture du code publié et de la documentation officielle à la date indiquée, et non de l’observation du trafic. Nous n’avons pas exécuté le programme avec un analyseur de réseau : c’est de l’analyse statique, pas de l’observation. Une capture réelle reste à faire ; le jour où nous l’aurons, ces cellules monteront d’un niveau de preuve. Nous préférons le dire plutôt que de vous laisser croire que nous avons reniflé les paquets.

Vers l’extérieur

Ce qui sort de votre machine

Les quatre questions auxquelles un logiciel local doit répondre avant de mériter vos documents : ce qu’il envoie de lui-même, qui d’autre il appelle, sur quelle adresse il écoute, et si vous pouvez le vérifier vous-même.

Télémétrie par défaut

Oui, activée d’usine — et ce n’est pas un avis au démarrage, c’est un battement toutes les dix minutes. Vérifié par nous à la source primaire

Que vLLM collecte des statistiques d’usage par défaut est documenté. Ce qui n’est pas dans la documentation, et n’apparaît qu’en lisant le code, c’est qu’il ne s’agit pas d’un envoi unique : la fonction de rapport continu exécute une boucle infinie qui dort 600 secondes et refait un POST, tant que le processus vit. La destination n’est pas non plus documentée : il faut aller au code pour trouver stats.vllm.ai. Les échecs réseau sont ignorés en silence. Ce qui part : identifiant aléatoire de l’exécution, fournisseur de cloud détecté en lisant les identifiants du matériel, nombre de cœurs, marque du processeur et famille/modèle/stepping, mémoire totale, chaîne complète du système d’exploitation, version de CUDA, nombre de GPU avec modèle et mémoire par appareil, cinq variables d’environnement, architecture du modèle chargé et, côté serveur, une vingtaine d’autres paramètres de démarrage. À son crédit, et il faut le dire : c’est le seul des cinq qui vous laisse voir exactement ce qu’il envoie, dans ~/.config/vllm/usage_stats.json, et il offre quatre façons de le couper.

«Report usage every 10 minutes. This helps us to collect more data points for uptime of vLLM usages.»

Comment le désactiver: N’importe laquelle de ces quatre : VLLM_NO_USAGE_STATS=1, DO_NOT_TRACK=1, VLLM_DO_NOT_TRACK=1, ou créer le fichier ~/.config/vllm/do_not_track. La documentation publie les trois premières ; la quatrième n’est que dans le code.

Source · consulté le 2026-08-25

Autres appels vers l’extérieur

Tous les appels que ce logiciel passe de lui-même : quoi, vers où, quand et si on peut les éviter
Quoi Vers où Quand Peut-on l’éviter Preuve
Statistiques d’usage stats.vllm.ai Au démarrage et toutes les 10 minutes, toujours, sauf désactivation. Oui, par quatre voies différentes vérifié par nous
Téléchargement de modèles, en s’identifiant comme vLLM huggingface.co (ou modelscope) Au chargement d’un modèle absent du cache. C’est le seul des cinq qui dit à Hugging Face quel runtime et quelle version télécharge. HF_HUB_OFFLINE=1 vérifié par nous
Point de métriques Prometheus : local, rien ne sort de votre machine local : rien ne quitte la machine Toujours : /metrics est monté par défaut. N’étant pas sous /v1, la clé d’API ne le couvre pas. Non documenté vérifié par nous

Source · consulté le 2026-08-25

Sur quelle adresse il écoute

L’adresse, l’authentification et la politique CORS livrées avec ce logiciel
Réglage D’origine
Écoute sur 0.0.0.0:8000
Authentification par défaut aucune
CORS par défaut Grand ouvert : n’importe quelle origine, méthode et en-tête

C’est celle qui compte. Dans la version publiée, le paramètre d’hôte n’a pas de valeur et se résout en chaîne vide, et se lier à la chaîne vide en IPv4 équivaut à INADDR_ANY, c’est-à-dire 0.0.0.0. Un `vllm serve modèle` sans autre paramètre laisse le modèle à la disposition de tout le réseau local, sans mot de passe. Nous avons vérifié la même valeur par défaut sur huit versions : ce n’est pas une régression récente. Et il y a un deuxième étage : leur propre page de sécurité reconnaît que la clé d’API ne suffit pas, parce qu’elle ne couvre que les préfixes /v1, /v2 et /inference alors que d’autres points sensibles restent sans authentification sur le même serveur. Leur recommandation est de le placer derrière un proxy inverse. Un troisième détail : la couche de communication de PyTorch ouvre un magasin qui écoute sur toutes les interfaces, même sur une seule machine, et le projet lui-même qualifie cela d’intrinsèquement non sécurisé. Vérifié par nous à la source primaire

«The –api-key flag (or VLLM_API_KEY environment variable) provides authentication for vLLM’s HTTP server, but only for OpenAI-compatible API endpoints under the /v1 path prefix […]. Many other sensitive endpoints are exposed on the same HTTP server without any authentication enforcement.»

Source · consulté le 2026-08-25

Peut-on l’auditer ?

Oui. Apache-2.0, le seul des cinq qui ne soit ni MIT ni propriétaire. Tout ce que dit cette fiche du battement de dix minutes et du 0.0.0.0 a été lu dans le code de l’étiquette publiée, non déduit de la documentation — qui dans les deux cas dit quelque chose de moins complet, et dans l’un des deux dit le contraire. Vérifié par nous à la source primaire

Source · consulté le 2026-08-25

Politique de confidentialité

Il n’y a pas de politique de confidentialité au sens habituel : il y a une page de documentation qui explique ce qu’ils collectent et comment le désactiver, et qui annonce la publication d’un sous-ensemble nettoyé et agrégé au bénéfice de la communauté. déclaré par l’éditeur Source

Couverture

Ce qu’il exécute, et où

Plateformes, accélérateurs et formats de modèle : les trois murs rencontrés dès le premier soir, et ceux que personne n’écrit avant de s’y être heurté.

Où il fonctionne

Prise en charge par plateforme, une ligne par plateforme
Plateforme Prise en charge Preuve
Windows Aucune prise en charge native. La voie officielle est WSL. déclaré par l’éditeur
macOS Apple Silicon Expérimental et en CPU seulement : leur documentation dit qu’il faut compiler depuis les sources. Le GPU ne passe pas par vLLM : il passe par un greffon communautaire qui utilise MLX en dessous et exige des modèles au format MLX. déclaré par l’éditeur
macOS Intel Nous n’avons pas pu le vérifier. Il n’y a ni roues ni documentation pour Mac Intel ; la section Apple Silicon est la seule section macOS qui existe et ses roues sont arm64. Nous rapportons l’absence, pas un « non ». non vérifié
Linux Oui, c’est sa plateforme. Python 3.10 à 3.13 d’après la documentation. déclaré par l’éditeur

Ce qu’il accélère

Accélérateurs matériels et leur état
Moteur État Preuve
CUDA Oui, et c’est le cas de première classe : le seul que leur propre site marque comme populaire. Exige une capacité de calcul 7.5 ou supérieure, ce qui exclut les GTX 10xx et antérieures. déclaré par l’éditeur
ROCm Oui, avec son propre index de paquets, mais plus étroit que CUDA : Python 3.12 et ROCm 7.0. déclaré par l’éditeur
CPU Oui, avec des limites : x86 (AVX512 recommandé, AVX2 en fonctions limitées), ARM avec NEON, et IBM Z. déclaré par l’éditeur
Metal Non, seulement par greffon externe : vLLM-Metal, maintenu par la communauté, qui utilise MLX en dessous. déclaré par l’éditeur
NPU / accélérateurs Pas dans le dépôt principal. TPU de Google, Intel Gaudi, AWS Neuron et Ascend sont des paquets séparés depuis la 0.27. déclaré par l’éditeur
Vulkan Nous n’avons pas pu le vérifier. Il n’apparaît pas sur leur page des plateformes prises en charge et il n’y a de déclaration dans aucun sens. non vérifié

Formats de modèle qu’il exécute

safetensors nativement, plus AWQ, GPTQ, FP8, compressed-tensors, bitsandbytes et une vingtaine d’autres schémas de quantification. GGUF n’est plus inclus : depuis la 0.27, il a été sorti dans un greffon à part et ils continuent eux-mêmes de le qualifier de hautement expérimental. Tout texte disant « vLLM prend en charge GGUF » sans cette nuance est dépassé. vérifié par nous

Source · consulté le 2026-08-25

Vivre avec

L’installer et vivre avec

Combien d’étapes jusqu’au premier token, ce qu’il laisse sur votre disque, sous quelle licence et à quel rythme il change sous vos pieds.

Étapes jusqu’au premier token

2 étapes. Installer le paquet et lancer `vllm serve <modèle>`. Il n’y a pas d’interface : on lui parle par API. La difficulté n’est pas de l’installer, mais qu’il n’y a rien à regarder et qu’il faut comprendre les paramètres de mémoire. vérifié par nous

Ce qu’il écrit sur votre disque

Ce que ce logiciel écrit sur votre disque et où
Quoi Preuve
Une copie locale de la télémétrie envoyée : leur documentation vous invite à la lire, et c’est le seul des cinq qui vous montre exactement ce qui sort ~/.config/vllm/usage_stats.json vérifié par nous
Fichier sentinelle pour désactiver la télémétrie : c’est vous qui le créez ~/.config/vllm/do_not_track — c’est vous qui le créez vérifié par nous
Cache de compilation de PyTorch ~/.cache/vllm (VLLM_CACHE_ROOT) déclaré par l’éditeur
Modèles : le cache de Hugging Face ~/.cache/huggingface — le cache de Hugging Face (HF_HOME) déclaré par l’éditeur
Historique des conversations : il n’existe pas. C’est un serveur d’API sans interface de discussion et il ne persiste rien des requêtes Nulle part : rien n’est écrit vérifié par nous

Licence

Apache-2.0. Le seul des cinq qui ne soit ni MIT ni propriétaire. vérifié par nous

Source · consulté le 2026-08-25

Version et rythme de publication

Une version mineure toutes les deux semaines environ, avec des correctifs en un à trois jours. Ce n’est pas mensuel : les derniers sauts mineurs ont été de 14, 12, 16 et 14 jours. Attention en datant un texte à son sujet : l’étiquette v0.28.0 existe depuis le 23 août 2026 sans publication, la 0.28 peut donc paraître n’importe quel jour. vérifié par nous

Source · consulté le 2026-08-25

Avertissements

À savoir avant de l’installer

  • C’est le seul des cinq avec la télémétrie activée d’usine, et ce n’est pas un avis au démarrage : il envoie un battement toutes les dix minutes tant que le serveur vit. À son crédit : il le documente, il laisse lire le contenu exact dans un fichier local et offre quatre façons de le couper.
  • C’est aussi le seul qui écoute sur 0.0.0.0 par défaut et sans clé. Un `vllm serve modèle` sans autre paramètre, sur un portable connecté au wifi d’un hôtel, laisse le modèle à la disposition de tout le réseau. Ce n’est pas une régression : c’est ainsi depuis au moins huit versions.
  • Leur propre page de sécurité prévient que la clé d’API ne couvre que les routes /v1, /v2 et /inference, et qu’il existe des points sensibles sans authentification sur le même serveur. La recommandation officielle est de le placer derrière un proxy inverse.
  • Il réserve 92 % de la mémoire de la carte dès le démarrage, et c’est une pré-allocation, pas un usage à la demande. Attention au chiffre : les 90 % qui circulent sur internet viennent d’un exemple figé dans leur propre documentation depuis la version 0.4.0.
  • vLLM ne publie nulle part un minimum de mémoire vidéo. Le seul prérequis matériel publié est la capacité de calcul 7.5. Nous n’inventons pas de chiffre.
  • Ce n’est pas un programme pour votre ordinateur. Pas d’interface, pas de Windows natif, et sur Mac seulement un backend CPU expérimental. Il est dans cette comparaison pour marquer la limite.