Startseite›Programme›MLX (mlx-lm)
MLX (mlx-lm)
Aktuelle Version mlx-lm 0.31.3 (mlx 0.32.1)2026-04-22 (mlx-lm) / 2026-08-18 (mlx)Geprüfter Stand mlx-lm tag v0.31.3 (lo que instala pip) y rama main del 2026-08-25; mlx 0.32.1Lizenz MIT
Für alle mit einem Apple-Silicon-Mac, die maximale native Leistung wollen und denen Python nichts ausmacht.
Apples Rechen-Framework für Apple Silicon, dazu die Schicht mlx-lm, die daraus eine Laufzeitumgebung für Sprachmodelle macht. Es sind zwei verschiedene Pakete: mlx ist das Rechen-Framework, wie NumPy oder PyTorch, und mlx-lm ist das, was wirklich Modelle ausführt. Es nutzt den vereinheitlichten Speicher: CPU und GPU teilen sich denselben Speicher ohne Kopien.
Schritte bis zum ersten Token
Herstellerangabe
Hosts, die es ab Werk kontaktiert
Von Local AI Scope gemessen
Lizenz
Von Local AI Scope gemessen
Wie wir das geprüft haben
Alles, was dieses Blatt über das Netz sagt, stammt aus dem Lesen des veröffentlichten Quellcodes und der offiziellen Dokumentation zum angegebenen Datum — nicht aus der Beobachtung des Datenverkehrs. Wir haben das Programm nicht mit einem Netzwerkanalysator laufen lassen: Das ist statische Analyse, keine Beobachtung. Eine echte Aufzeichnung steht noch aus; sobald es sie gibt, steigen diese Zellen eine Evidenzstufe. Das sagen wir lieber, als Sie annehmen zu lassen, wir hätten die Pakete mitgelesen.
Was Ihren Rechner verlässt
Die vier Fragen, die ein lokales Programm beantworten muss, bevor es Ihre Dokumente verdient: Was schickt es von sich aus hinaus, wen ruft es sonst noch, auf welcher Adresse hört es, und können Sie das selbst nachprüfen?
Telemetrie ab Werk
Keine eigene — es erbt die der Download-Bibliothek. Von uns an der Primärquelle geprüft
Wir haben das gesamte Paket mlx_lm durchsucht, sowohl den Hauptzweig als auch die veröffentlichte 0.31.3, nach telemetry, analytics, posthog, sentry, mixpanel und usage stats: null Treffer in beiden. Ebenso im Framework mlx. Aber mlx-lm lädt über huggingface_hub herunter, und diese Bibliothek erhebt standardmäßig Daten. Das ist die übertragbare Erkenntnis der ganzen Vergleichstabelle: Die Telemetrie steckt nicht in der Laufzeitumgebung, sie steckt in der Download-Bibliothek. Ein vielsagendes Detail: mlx-lm identifiziert sich gegenüber Hugging Face gar nicht, sodass sein User-Agent-Kopf wörtlich mit „unknown/None“ beginnt.
«By default, some data is collected by HF libraries (transformers, datasets, gradio,..) to monitor usage […]. You can set HF_HUB_DISABLE_TELEMETRY=1 as environment variable to globally disable telemetry.»
So schaltet man es ab: HF_HUB_DISABLE_TELEMETRY=1 oder das herstellerübergreifende DO_NOT_TRACK=1. Für den Betrieb ganz ohne Netz HF_HUB_OFFLINE=1 — die Dokumentation von Hugging Face warnt, dass selbst bei bereits zwischengespeichertem Modell eine HTTP-Anfrage erfolgt, um auf eine neuere Dateiversion zu prüfen.
Quelle · abgerufen am 2026-08-25
Andere Rufe nach Hause
| Was | Wohin | Wann | Vermeidbar | Beleg |
|---|---|---|---|---|
| Modell-Download | huggingface.co (oder modelscope mit MLXLM_USE_MODELSCOPE) |
Wenn Sie ein Modell anfordern, das nicht im Cache liegt, und um bei zwischengespeicherten auf neuere Versionen zu prüfen. | HF_HUB_OFFLINE=1 | von uns geprüft |
| Kalibrierungsdatei zum Quantisieren | ein GitHub-Gist |
Ein einziges Mal, und nur wenn Sie mit AWQ, DWQ oder GPTQ quantisieren. | Diese Verfahren nicht benutzen | von uns geprüft |
Quelle · abgerufen am 2026-08-25
Auf welcher Adresse es lauscht
| Einstellung | Ab Werk |
|---|---|
| Lauscht auf | 127.0.0.1:8080 |
| Authentifizierung ab Werk | keine |
| CORS ab Werk | Sperrangelweit offen: jeder Ursprung, jede Methode, jeder Kopf |
Es lauscht auf localhost, aber mit sperrangelweit offenem CORS — jeder Ursprung, jede Methode, jeder Kopf — und ganz ohne Authentifizierung: Die eigenen Beispiele schreiben api_key=”not-needed”. Der Server steckt in der Standardbibliothek von Python, nicht in einem Produktionsserver, und die Dokumentation sagt das auch. Ein zitierfähiges Detail: Diese Dokumentationsdatei reist nicht im PyPI-Paket mit, sodass wer mit pip installiert, die Warnung nie zu sehen bekommt — außer er geht ins Repositorium. Von uns an der Primärquelle geprüft
«The MLX LM server is not recommended for production as it only implements basic security checks.»
Quelle · abgerufen am 2026-08-25
Lässt es sich überprüfen?
Ja. MIT, Apple Inc., sowohl mlx als auch mlx-lm. Genau das erlaubt uns, „keine eigene Telemetrie“ als geprüfte Abwesenheit und nicht als Behauptung zu sagen — und vor allem, zu sagen, dass es genau zwei Gerätetypen gibt. Von uns an der Primärquelle geprüft
Quelle · abgerufen am 2026-08-25
Datenschutzerklärung
Es gibt keine Datenschutzerklärung, und das ist hier kein Mangel: Hinter dem Programm steht kein Dienst und kein Verantwortlicher, von dem man sie verlangen könnte. ungeprüft
Was es ausführt, und wo
Plattformen, Beschleuniger und Modellformate: die drei Wände, gegen die man am ersten Abend läuft, und die niemand aufschreibt, bevor er dagegen lief.
Wo es läuft
| Plattform | Unterstützung | Beleg |
|---|---|---|
| Windows | Teilweise und undokumentiert. Das Framework mlx veröffentlicht seit Juli 2026 offizielle Windows-Wheels (x64 und ARM64) und testet sie in der CI, aber seine Dokumentation erwähnt Windows nirgends, und mlx-lm deklariert seine Abhängigkeit nur für macOS: Außerhalb von macOS installiert `pip install mlx-lm` den Motor nicht. Ob mlx-lm unter Windows läuft, ist ungeprüft. | von uns geprüft |
| macOS Apple Silicon | Ja, das ist seine Plattform. macOS 14.0 oder neuer zur Installation; einige Funktionen für große Modelle verlangen macOS 15. | von uns geprüft |
| macOS Intel | Nein. Alle macOS-Wheels sind arm64; ein x86_64 existiert nicht. Vorsicht mit Python unter Rosetta: Der eigene Leitfaden warnt vor diesem Fall. | von uns geprüft |
| Linux | Ja für das Framework mlx, das ein CUDA-Backend und eine Nur-CPU-Version hat. Ob mlx-lm dort gut läuft, haben wir nicht überprüft: Sein README spricht nur von Apple Silicon. | Herstellerangabe |
Was es beschleunigt
| Backend | Status | Beleg |
|---|---|---|
| Metal | Ja: der native Weg auf Apple Silicon, mit vereinheitlichtem Speicher — CPU und GPU teilen sich denselben Speicher, ohne Daten zwischen ihnen zu kopieren. | Herstellerangabe |
| CUDA | Ja, im Framework mlx unter Linux, mit NVIDIA-Architektur SM 7.5 oder höher. | Herstellerangabe |
| CPU | Ja. Einer der einzigen zwei Gerätetypen, die es in MLX gibt. | von uns geprüft |
| ROCm | Konnten wir nicht überprüfen. Die Installationsdokumentation bietet nur Apple Silicon, CUDA und CPU an, doch nirgends erklären sie, AMD werde nicht unterstützt — wir melden also die Abwesenheit, kein „nein“. | ungeprüft |
| Vulkan | Konnten wir nicht überprüfen. Es taucht weder in der Dokumentation noch im Backend-Baum auf, und es gibt keine Aussage in irgendeine Richtung. | ungeprüft |
| Neural Engine | Nein, und diese Abwesenheit ist geprüft und keine fehlende Quelle: Die Aufzählung der Gerätetypen im Code hat genau zwei Werte, cpu und gpu, und die öffentliche Dokumentation sagt dasselbe. Viele nehmen an, MLX nutze die Neural Engine. Tut es nicht. | von uns geprüft |
«Currently supported device types are the CPU and GPU.»
Modellformate, die es ausführt
MLX-Format und safetensors von Hugging Face. Es kann kein GGUF ausführen. Es kann nur nach GGUF exportieren, nachdem ein Adapter verschmolzen wurde — und selbst dann nur für Modelle im Stil von Mistral, Mixtral und Llama in fp16. von uns geprüft
Quelle · abgerufen am 2026-08-25
Installieren und damit leben
Wie viele Schritte bis zum ersten Token, was es auf der Festplatte hinterlässt, unter welcher Lizenz und in welchem Tempo es sich ändert.
Schritte bis zum ersten Token
2 Schritte. Paket installieren und mlx_lm.generate oder mlx_lm.chat ausführen: Es lädt das Standardmodell und antwortet. Herstellerangabe
Was es auf Ihre Festplatte schreibt
| Was | Wo | Beleg |
|---|---|---|
| Modelle: der Cache von Hugging Face | ~/.cache/huggingface/hub — der Cache von Hugging Face (HF_HOME · HF_HUB_CACHE) |
Herstellerangabe |
| Gesprächsverlauf: wird nicht gespeichert. Der Kontext lebt im Arbeitsspeicher und geht beim Beenden verloren. Es ist das einzige der fünf, das keine Spur Ihrer Gespräche auf der Platte hinterlässt | Nirgends — es wird nichts geschrieben | von uns geprüft |
| Kalibrierungsdatei der Quantisierung: entsteht nur, wenn Sie mit AWQ, DWQ oder GPTQ quantisieren | ~/.cache/mlx-lm/ |
von uns geprüft |
Lizenz
MIT, Apple Inc. Sowohl das Framework als auch mlx-lm. von uns geprüft
Quelle · abgerufen am 2026-08-25
Version und Veröffentlichungstakt
Historisch alle ein bis drei Wochen eine Version, doch die Veröffentlichung steht seit dem 22. April 2026 still, obwohl täglich weiterentwickelt wird. Das Framework mlx veröffentlicht sehr wohl: rund sechzehn Versionen im Jahr. von uns geprüft
Quelle · abgerufen am 2026-08-25
Was Sie vor der Installation wissen sollten
- Das Paket, das die Leute installieren, ist seit vier Monaten eingefroren. `pip install mlx-lm` liefert heute Version 0.31.3 vom 22. April 2026, während das Repositorium täglich Commits erhält und seine Versionsdatei bereits 0.32.0 zeigt. Seit April hinzugekommene Modelle gibt es nur, wenn Sie aus dem Repositorium installieren. Es gibt keine primäre Ankündigung, die das erklärt: Wir stellen die Tatsache fest, nicht den Grund.
- MLX nutzt die Neural Engine nicht. Die Gerätetypen in seinem Code sind genau zwei: CPU und GPU.
- Es führt kein GGUF aus. Wenn Ihre Modellsammlung GGUF ist, nützt Ihnen MLX ohne Umwandlung nichts.
- Der Server lauscht auf localhost, aber mit sperrangelweit offenem CORS und ganz ohne Authentifizierung, und die eigene Dokumentation warnt, dass er nicht für den Produktivbetrieb gedacht ist. Diese Warnung reist nicht im PyPI-Paket mit.
- Es ist das einzige der fünf, das Gespräche nicht auf der Festplatte speichert.