MLX (mlx-lm)
Versión vigente mlx-lm 0.31.3 (mlx 0.32.1)2026-04-22 (mlx-lm) / 2026-08-18 (mlx)Árbol auditado mlx-lm tag v0.31.3 (lo que instala pip) y rama main del 2026-08-25; mlx 0.32.1Licencia MIT
Para quien tiene un Mac con Apple Silicon, quiere el máximo rendimiento nativo y no le importa Python.
El framework de cálculo de Apple para Apple Silicon, más la capa mlx-lm que lo convierte en runtime de modelos de lenguaje. Son dos paquetes distintos: mlx es el framework de cálculo, como NumPy o PyTorch, y mlx-lm es lo que de verdad ejecuta modelos. Aprovecha la memoria unificada: CPU y GPU comparten el mismo banco sin copias.
Pasos hasta el primer token
Declarado por el fabricante
Sitios a los que llama de fábrica
Medido por Local AI Scope
Licencia
Medido por Local AI Scope
Cómo lo hemos comprobado
Todo lo que esta ficha dice sobre la red sale de leer el código publicado y la documentación oficial en la fecha indicada, no de observar el tráfico. No hemos ejecutado el programa con un analizador de red delante, así que esto es análisis estático, no observación. Una captura real sigue pendiente; el día que la haya, estas celdas suben un nivel de evidencia. Preferimos decirlo a que des por hecho que hemos mirado los paquetes.
Qué sale de tu equipo
Las cuatro preguntas que un programa local tiene que contestar antes de merecer tus documentos: qué manda por su cuenta, a quién más llama, en qué dirección escucha y si puedes comprobarlo tú mismo.
Telemetría de fábrica
Ninguna propia: hereda la de la librería de descarga. Verificado por nosotros en la fuente primaria
Barrimos el paquete mlx_lm entero, tanto la rama principal como la 0.31.3 publicada, buscando telemetry, analytics, posthog, sentry, mixpanel y usage stats: cero coincidencias en ambos. Lo mismo en el framework mlx. Pero mlx-lm descarga con huggingface_hub, y esa librería sí recoge datos por defecto. Este es el hallazgo transferible de toda la comparativa: la telemetría no la mete el runtime, la mete la librería de descarga. Un detalle que dice mucho: mlx-lm no se identifica ante Hugging Face, así que su cabecera de agente de usuario empieza literalmente por «unknown/None».
«By default, some data is collected by HF libraries (transformers, datasets, gradio,..) to monitor usage […]. You can set HF_HUB_DISABLE_TELEMETRY=1 as environment variable to globally disable telemetry.»
Cómo se apaga: HF_HUB_DISABLE_TELEMETRY=1, o el estándar entre fabricantes DO_NOT_TRACK=1. Para un uso totalmente sin red, HF_HUB_OFFLINE=1: la propia documentación de Hugging Face avisa de que, aunque el modelo ya esté en caché, se hace una petición HTTP para comprobar si hay versión nueva del fichero.
Fuente · consultado el 2026-08-25
Otras llamadas a casa
| Qué | A dónde | Cuándo | Se puede evitar | Evidencia |
|---|---|---|---|---|
| Descarga de modelos | huggingface.co (o modelscope si se activa MLXLM_USE_MODELSCOPE) |
Al pedir un modelo que no está en caché, y para comprobar si hay versión nueva de los que sí lo están. | HF_HUB_OFFLINE=1 | verificado por nosotros |
| Fichero de calibración para cuantizar | un gist de GitHub |
Una sola vez, y solo si cuantizas con AWQ, DWQ o GPTQ. | No usar esos métodos | verificado por nosotros |
Fuente · consultado el 2026-08-25
En qué dirección escucha
| Ajuste | De fábrica |
|---|---|
| Escucha en | 127.0.0.1:8080 |
| Autenticación de fábrica | ninguna |
| CORS de fábrica | Abierto de par en par: cualquier origen, cualquier método, cualquier cabecera |
Escucha en localhost, pero con el CORS abierto de par en par —cualquier origen, cualquier método, cualquier cabecera— y sin autenticación de ningún tipo: sus propios ejemplos ponen api_key=»not-needed». El servidor lo implementa la librería estándar de Python, no un servidor de producción, y su documentación lo advierte. Un detalle citable: ese fichero de documentación no viaja dentro del paquete de PyPI, así que quien instale con pip no ve la advertencia salvo que vaya al repositorio. Verificado por nosotros en la fuente primaria
«The MLX LM server is not recommended for production as it only implements basic security checks.»
Fuente · consultado el 2026-08-25
¿Se puede auditar?
Sí. MIT, de Apple Inc., tanto mlx como mlx-lm. Eso es lo que nos permite decir «sin telemetría propia» como ausencia comprobada y no como afirmación — y, sobre todo, lo que nos permite decir que sus tipos de dispositivo son exactamente dos. Verificado por nosotros en la fuente primaria
Fuente · consultado el 2026-08-25
Política de privacidad
No hay política de privacidad, y aquí eso no es una carencia: no existe ningún servicio detrás del programa ni responsable del tratamiento a quien exigírsela. sin verificar
Qué ejecuta y dónde
Plataformas, aceleradores y formatos de modelo: los tres muros con los que se choca la primera noche, y los que nadie escribe hasta haberse chocado.
Dónde funciona
| Plataforma | Soporte | Evidencia |
|---|---|---|
| Windows | Parcial y sin documentar. El framework mlx publica ruedas oficiales de Windows (x64 y ARM64) desde julio de 2026 y las prueba en su integración continua, pero su documentación no menciona Windows en ninguna parte, y mlx-lm declara su dependencia solo para macOS: fuera de macOS, `pip install mlx-lm` no instala el motor. Que mlx-lm funcione en Windows no está verificado. | verificado por nosotros |
| macOS Apple Silicon | Sí, es su plataforma. macOS 14.0 o superior para instalar; algunas funciones de modelos grandes exigen macOS 15. | verificado por nosotros |
| macOS Intel | No. Todas las ruedas de macOS son arm64; no existe ninguna x86_64. Ojo con ejecutar Python bajo Rosetta: su propia guía avisa de ese caso. | verificado por nosotros |
| Linux | Sí para el framework mlx, que tiene backend CUDA y versión de solo CPU. Que mlx-lm funcione bien ahí no lo hemos verificado: su README solo habla de Apple Silicon. | declarado por el fabricante |
Qué acelera
| Motor | Estado | Evidencia |
|---|---|---|
| Metal | Sí: es el camino nativo en Apple Silicon, con memoria unificada: CPU y GPU comparten el mismo banco sin copiar datos entre ellos. | declarado por el fabricante |
| CUDA | Sí, en el framework mlx sobre Linux, exigiendo arquitectura NVIDIA SM 7.5 o superior. | declarado por el fabricante |
| CPU | Sí. Es uno de los dos únicos tipos de dispositivo que existen en MLX. | verificado por nosotros |
| ROCm | No lo hemos podido verificar. Su documentación de instalación solo ofrece Apple Silicon, CUDA y CPU, pero en ninguna parte declaran que AMD no esté soportado, así que reportamos la ausencia y no un «no». | sin verificar |
| Vulkan | No lo hemos podido verificar. No aparece en la documentación ni en el árbol de backends, y no hay declaración en ningún sentido. | sin verificar |
| Neural Engine | No, y esta sí es una ausencia verificada y no una fuente que falta: el enumerado de tipos de dispositivo del código tiene exactamente dos valores, cpu y gpu, y la documentación pública lo dice igual. Mucha gente supone que MLX usa el Neural Engine. No lo usa. | verificado por nosotros |
«Currently supported device types are the CPU and GPU.»
Formatos de modelo que ejecuta
Formato MLX y safetensors de Hugging Face. No puede ejecutar un GGUF. Solo sabe exportar a GGUF tras fusionar un adaptador, y aun así solo para modelos estilo Mistral, Mixtral y Llama en fp16. verificado por nosotros
Fuente · consultado el 2026-08-25
Instalarlo y convivir con él
Cuántos pasos hasta el primer token, qué deja en tu disco, bajo qué licencia y a qué ritmo cambia por debajo.
Pasos hasta el primer token
2 pasos. Instalar el paquete y ejecutar mlx_lm.generate o mlx_lm.chat: descarga el modelo por defecto y responde. declarado por el fabricante
Qué escribe en tu disco
| Qué | Dónde | Evidencia |
|---|---|---|
| Modelos: la caché de Hugging Face | ~/.cache/huggingface/hub — la caché de Hugging Face (HF_HOME · HF_HUB_CACHE) |
declarado por el fabricante |
| Historial de conversaciones: no se guarda. El contexto vive en memoria y se pierde al salir. Es el único de los cinco que no deja rastro de tus conversaciones en disco | En ningún sitio: no se escribe nada | verificado por nosotros |
| Fichero de calibración de cuantización: solo se crea si cuantizas con AWQ, DWQ o GPTQ | ~/.cache/mlx-lm/ |
verificado por nosotros |
Licencia
MIT, de Apple Inc. Tanto el framework como mlx-lm. verificado por nosotros
Fuente · consultado el 2026-08-25
Versión y ritmo de publicación
Históricamente una versión cada una a tres semanas, pero la publicación lleva parada desde el 22 de abril de 2026 aunque el desarrollo continúa a diario. El framework mlx sí publica: unas dieciséis versiones al año. verificado por nosotros
Fuente · consultado el 2026-08-25
Lo que conviene saber antes de instalarlo
- El paquete que instala la gente lleva cuatro meses congelado. `pip install mlx-lm` da hoy la versión 0.31.3 del 22 de abril de 2026, mientras el repositorio recibe commits a diario y su fichero de versión ya marca 0.32.0. Los modelos añadidos desde abril solo están si instalas desde el repositorio. No hay ningún anuncio primario que lo explique: constatamos el hecho, no el motivo.
- MLX no usa el Neural Engine. Los tipos de dispositivo que existen en su código son exactamente dos: CPU y GPU.
- No ejecuta GGUF. Si tu colección de modelos es GGUF, MLX no te sirve sin reconvertirlos.
- El servidor escucha en localhost pero con el CORS abierto de par en par y sin ninguna autenticación, y su propia documentación advierte de que no es para producción. Esa advertencia no viaja dentro del paquete de PyPI.
- Es el único de los cinco que no guarda las conversaciones en disco.