Accueil›Logiciels›MLX (mlx-lm)
MLX (mlx-lm)
Version en vigueur mlx-lm 0.31.3 (mlx 0.32.1)2026-04-22 (mlx-lm) / 2026-08-18 (mlx)Arbre audité mlx-lm tag v0.31.3 (lo que instala pip) y rama main del 2026-08-25; mlx 0.32.1Licence MIT
Pour qui possède un Mac Apple Silicon, veut le maximum de performance native et que Python ne dérange pas.
Le framework de calcul d’Apple pour Apple Silicon, plus la couche mlx-lm qui en fait un runtime de modèles de langage. Ce sont deux paquets distincts : mlx est le framework de calcul, comme NumPy ou PyTorch, et mlx-lm est ce qui exécute réellement les modèles. Il exploite la mémoire unifiée : CPU et GPU partagent le même banc sans copie.
Étapes jusqu’au premier token
Déclaré par le fabricant
Hôtes qu’il contacte d’origine
Mesuré par Local AI Scope
Licence
Mesuré par Local AI Scope
Comment nous l’avons vérifié
Tout ce que cette fiche affirme sur le réseau vient de la lecture du code publié et de la documentation officielle à la date indiquée, et non de l’observation du trafic. Nous n’avons pas exécuté le programme avec un analyseur de réseau : c’est de l’analyse statique, pas de l’observation. Une capture réelle reste à faire ; le jour où nous l’aurons, ces cellules monteront d’un niveau de preuve. Nous préférons le dire plutôt que de vous laisser croire que nous avons reniflé les paquets.
Ce qui sort de votre machine
Les quatre questions auxquelles un logiciel local doit répondre avant de mériter vos documents : ce qu’il envoie de lui-même, qui d’autre il appelle, sur quelle adresse il écoute, et si vous pouvez le vérifier vous-même.
Télémétrie par défaut
Aucune en propre : il hérite de celle de la bibliothèque de téléchargement. Vérifié par nous à la source primaire
Nous avons balayé tout le paquet mlx_lm, la branche principale comme la 0.31.3 publiée, à la recherche de telemetry, analytics, posthog, sentry, mixpanel et usage stats : zéro correspondance dans les deux. Idem dans le framework mlx. Mais mlx-lm télécharge via huggingface_hub, et cette bibliothèque collecte bien des données par défaut. C’est le constat transposable de toute la comparaison : la télémétrie n’est pas mise par le runtime, elle est mise par la bibliothèque de téléchargement. Un détail parlant : mlx-lm ne s’identifie pas auprès de Hugging Face, si bien que son en-tête d’agent utilisateur commence littéralement par « unknown/None ».
«By default, some data is collected by HF libraries (transformers, datasets, gradio,..) to monitor usage […]. You can set HF_HUB_DISABLE_TELEMETRY=1 as environment variable to globally disable telemetry.»
Comment le désactiver: HF_HUB_DISABLE_TELEMETRY=1, ou le standard inter-éditeurs DO_NOT_TRACK=1. Pour un usage totalement hors ligne, HF_HUB_OFFLINE=1 : la documentation de Hugging Face prévient que, même si le modèle est déjà en cache, une requête HTTP est émise pour vérifier s’il existe une version plus récente du fichier.
Source · consulté le 2026-08-25
Autres appels vers l’extérieur
| Quoi | Vers où | Quand | Peut-on l’éviter | Preuve |
|---|---|---|---|---|
| Téléchargement de modèles | huggingface.co (ou modelscope avec MLXLM_USE_MODELSCOPE) |
À la demande d’un modèle absent du cache, et pour vérifier si ceux qui y sont ont une version plus récente. | HF_HUB_OFFLINE=1 | vérifié par nous |
| Fichier de calibration pour la quantification | un gist GitHub |
Une seule fois, et uniquement si vous quantifiez avec AWQ, DWQ ou GPTQ. | Ne pas utiliser ces méthodes | vérifié par nous |
Source · consulté le 2026-08-25
Sur quelle adresse il écoute
| Réglage | D’origine |
|---|---|
| Écoute sur | 127.0.0.1:8080 |
| Authentification par défaut | aucune |
| CORS par défaut | Grand ouvert : n’importe quelle origine, méthode et en-tête |
Il écoute sur localhost, mais avec le CORS grand ouvert — n’importe quelle origine, n’importe quelle méthode, n’importe quel en-tête — et sans aucune authentification : ses propres exemples écrivent api_key=”not-needed”. Le serveur est bâti sur la bibliothèque standard de Python, pas sur un serveur de production, et sa documentation le dit. Un détail citable : ce fichier de documentation ne voyage pas dans le paquet PyPI, de sorte que celui qui installe avec pip ne voit jamais l’avertissement, sauf à se rendre sur le dépôt. Vérifié par nous à la source primaire
«The MLX LM server is not recommended for production as it only implements basic security checks.»
Source · consulté le 2026-08-25
Peut-on l’auditer ?
Oui. MIT, Apple Inc., pour mlx comme pour mlx-lm. C’est ce qui nous permet de dire « sans télémétrie propre » comme une absence vérifiée et non comme une affirmation — et surtout de dire que ses types de périphérique sont exactement deux. Vérifié par nous à la source primaire
Source · consulté le 2026-08-25
Politique de confidentialité
Il n’existe pas de politique de confidentialité, et ce n’est pas un manque ici : aucun service ne se cache derrière le programme et il n’y a pas de responsable de traitement à qui la réclamer. non vérifié
Ce qu’il exécute, et où
Plateformes, accélérateurs et formats de modèle : les trois murs rencontrés dès le premier soir, et ceux que personne n’écrit avant de s’y être heurté.
Où il fonctionne
| Plateforme | Prise en charge | Preuve |
|---|---|---|
| Windows | Partiel et non documenté. Le framework mlx publie des roues Windows officielles (x64 et ARM64) depuis juillet 2026 et les teste en intégration continue, mais sa documentation ne mentionne Windows nulle part, et mlx-lm déclare sa dépendance pour macOS seulement : hors macOS, `pip install mlx-lm` n’installe pas le moteur. Que mlx-lm fonctionne sous Windows n’est pas vérifié. | vérifié par nous |
| macOS Apple Silicon | Oui, c’est sa plateforme. macOS 14.0 ou plus récent pour l’installer ; certaines fonctions pour grands modèles exigent macOS 15. | vérifié par nous |
| macOS Intel | Non. Toutes les roues macOS sont arm64 ; il n’en existe aucune x86_64. Attention à Python sous Rosetta : leur propre guide met en garde sur ce cas. | vérifié par nous |
| Linux | Oui pour le framework mlx, qui a un backend CUDA et une version CPU seule. Que mlx-lm y fonctionne bien, nous ne l’avons pas vérifié : son README ne parle que d’Apple Silicon. | déclaré par l’éditeur |
Ce qu’il accélère
| Moteur | État | Preuve |
|---|---|---|
| Metal | Oui : c’est la voie native sur Apple Silicon, avec mémoire unifiée — CPU et GPU partagent le même banc sans copier de données entre eux. | déclaré par l’éditeur |
| CUDA | Oui, dans le framework mlx sous Linux, avec une architecture NVIDIA SM 7.5 ou supérieure. | déclaré par l’éditeur |
| CPU | Oui. C’est l’un des deux seuls types de périphérique qui existent dans MLX. | vérifié par nous |
| ROCm | Nous n’avons pas pu le vérifier. Leur documentation d’installation n’offre qu’Apple Silicon, CUDA et CPU, mais nulle part ils ne déclarent qu’AMD n’est pas pris en charge : nous rapportons l’absence, pas un « non ». | non vérifié |
| Vulkan | Nous n’avons pas pu le vérifier. Il n’apparaît ni dans la documentation ni dans l’arbre des backends, et il n’y a de déclaration dans aucun sens. | non vérifié |
| Neural Engine | Non, et cette absence-là est vérifiée, pas une source manquante : l’énumération des types de périphérique dans le code compte exactement deux valeurs, cpu et gpu, et la documentation publique le dit aussi. Beaucoup de gens supposent que MLX utilise le Neural Engine. Il ne l’utilise pas. | vérifié par nous |
«Currently supported device types are the CPU and GPU.»
Formats de modèle qu’il exécute
Format MLX et safetensors de Hugging Face. Il ne peut pas exécuter un GGUF. Il sait seulement exporter vers GGUF après fusion d’un adaptateur, et encore, uniquement pour des modèles de type Mistral, Mixtral et Llama en fp16. vérifié par nous
Source · consulté le 2026-08-25
L’installer et vivre avec
Combien d’étapes jusqu’au premier token, ce qu’il laisse sur votre disque, sous quelle licence et à quel rythme il change sous vos pieds.
Étapes jusqu’au premier token
2 étapes. Installer le paquet et lancer mlx_lm.generate ou mlx_lm.chat : il télécharge le modèle par défaut et répond. déclaré par l’éditeur
Ce qu’il écrit sur votre disque
| Quoi | Où | Preuve |
|---|---|---|
| Modèles : le cache de Hugging Face | ~/.cache/huggingface/hub — le cache de Hugging Face (HF_HOME · HF_HUB_CACHE) |
déclaré par l’éditeur |
| Historique des conversations : non enregistré. Le contexte vit en mémoire et se perd à la fermeture. C’est le seul des cinq qui ne laisse aucune trace de vos conversations sur le disque | Nulle part : rien n’est écrit | vérifié par nous |
| Fichier de calibration de quantification : créé seulement si vous quantifiez avec AWQ, DWQ ou GPTQ | ~/.cache/mlx-lm/ |
vérifié par nous |
Licence
MIT, Apple Inc. Le framework comme mlx-lm. vérifié par nous
Source · consulté le 2026-08-25
Version et rythme de publication
Historiquement une version toutes les une à trois semaines, mais la publication est à l’arrêt depuis le 22 avril 2026 alors que le développement continue chaque jour. Le framework mlx, lui, publie : environ seize versions par an. vérifié par nous
Source · consulté le 2026-08-25
À savoir avant de l’installer
- Le paquet que les gens installent est gelé depuis quatre mois. `pip install mlx-lm` donne aujourd’hui la version 0.31.3 du 22 avril 2026, alors que le dépôt reçoit des commits quotidiens et que son fichier de version affiche déjà 0.32.0. Les modèles ajoutés depuis avril n’y sont que si vous installez depuis le dépôt. Aucun communiqué primaire ne l’explique : nous constatons le fait, pas le motif.
- MLX n’utilise pas le Neural Engine. Les types de périphérique qui existent dans son code sont exactement deux : CPU et GPU.
- Il n’exécute pas de GGUF. Si votre collection de modèles est en GGUF, MLX ne vous sert à rien sans reconversion.
- Le serveur écoute sur localhost mais avec le CORS grand ouvert et sans aucune authentification, et sa propre documentation avertit qu’il n’est pas fait pour la production. Cet avertissement ne voyage pas dans le paquet PyPI.
- C’est le seul des cinq qui ne conserve pas les conversations sur le disque.