InicioProgramasMLX (mlx-lm)

Ficha de programa

MLX (mlx-lm)

Versión vigente mlx-lm 0.31.3 (mlx 0.32.1)2026-04-22 (mlx-lm) / 2026-08-18 (mlx)Árbol auditado mlx-lm tag v0.31.3 (lo que instala pip) y rama main del 2026-08-25; mlx 0.32.1Licencia MIT

Para quien tiene un Mac con Apple Silicon, quiere el máximo rendimiento nativo y no le importa Python.

El framework de cálculo de Apple para Apple Silicon, más la capa mlx-lm que lo convierte en runtime de modelos de lenguaje. Son dos paquetes distintos: mlx es el framework de cálculo, como NumPy o PyTorch, y mlx-lm es lo que de verdad ejecuta modelos. Aprovecha la memoria unificada: CPU y GPU comparten el mismo banco sin copias.

De un vistazo
Versión y ritmo de publicaciónmlx-lm 0.31.3 (mlx 0.32.1)
En qué dirección escucha127.0.0.1:8080
Pasos hasta el primer token2 pasos
Sitios a los que llama de fábrica2
LicenciaMIT
2

Pasos hasta el primer token

Declarado por el fabricante

2

Sitios a los que llama de fábrica

Medido por Local AI Scope

MIT

Licencia

Medido por Local AI Scope

Método

Cómo lo hemos comprobado

Todo lo que esta ficha dice sobre la red sale de leer el código publicado y la documentación oficial en la fecha indicada, no de observar el tráfico. No hemos ejecutado el programa con un analizador de red delante, así que esto es análisis estático, no observación. Una captura real sigue pendiente; el día que la haya, estas celdas suben un nivel de evidencia. Preferimos decirlo a que des por hecho que hemos mirado los paquetes.

Hacia fuera

Qué sale de tu equipo

Las cuatro preguntas que un programa local tiene que contestar antes de merecer tus documentos: qué manda por su cuenta, a quién más llama, en qué dirección escucha y si puedes comprobarlo tú mismo.

Telemetría de fábrica

Ninguna propia: hereda la de la librería de descarga. Verificado por nosotros en la fuente primaria

Barrimos el paquete mlx_lm entero, tanto la rama principal como la 0.31.3 publicada, buscando telemetry, analytics, posthog, sentry, mixpanel y usage stats: cero coincidencias en ambos. Lo mismo en el framework mlx. Pero mlx-lm descarga con huggingface_hub, y esa librería sí recoge datos por defecto. Este es el hallazgo transferible de toda la comparativa: la telemetría no la mete el runtime, la mete la librería de descarga. Un detalle que dice mucho: mlx-lm no se identifica ante Hugging Face, así que su cabecera de agente de usuario empieza literalmente por «unknown/None».

«By default, some data is collected by HF libraries (transformers, datasets, gradio,..) to monitor usage […]. You can set HF_HUB_DISABLE_TELEMETRY=1 as environment variable to globally disable telemetry.»

Cómo se apaga: HF_HUB_DISABLE_TELEMETRY=1, o el estándar entre fabricantes DO_NOT_TRACK=1. Para un uso totalmente sin red, HF_HUB_OFFLINE=1: la propia documentación de Hugging Face avisa de que, aunque el modelo ya esté en caché, se hace una petición HTTP para comprobar si hay versión nueva del fichero.

Fuente · consultado el 2026-08-25

Otras llamadas a casa

Todas las llamadas que este programa hace por su cuenta: qué, adónde, cuándo y si se pueden evitar
Qué A dónde Cuándo Se puede evitar Evidencia
Descarga de modelos huggingface.co (o modelscope si se activa MLXLM_USE_MODELSCOPE) Al pedir un modelo que no está en caché, y para comprobar si hay versión nueva de los que sí lo están. HF_HUB_OFFLINE=1 verificado por nosotros
Fichero de calibración para cuantizar un gist de GitHub Una sola vez, y solo si cuantizas con AWQ, DWQ o GPTQ. No usar esos métodos verificado por nosotros

Fuente · consultado el 2026-08-25

En qué dirección escucha

La dirección, la autenticación y la política CORS con las que viene este programa
Ajuste De fábrica
Escucha en 127.0.0.1:8080
Autenticación de fábrica ninguna
CORS de fábrica Abierto de par en par: cualquier origen, cualquier método, cualquier cabecera

Escucha en localhost, pero con el CORS abierto de par en par —cualquier origen, cualquier método, cualquier cabecera— y sin autenticación de ningún tipo: sus propios ejemplos ponen api_key=»not-needed». El servidor lo implementa la librería estándar de Python, no un servidor de producción, y su documentación lo advierte. Un detalle citable: ese fichero de documentación no viaja dentro del paquete de PyPI, así que quien instale con pip no ve la advertencia salvo que vaya al repositorio. Verificado por nosotros en la fuente primaria

«The MLX LM server is not recommended for production as it only implements basic security checks.»

Fuente · consultado el 2026-08-25

¿Se puede auditar?

Sí. MIT, de Apple Inc., tanto mlx como mlx-lm. Eso es lo que nos permite decir «sin telemetría propia» como ausencia comprobada y no como afirmación — y, sobre todo, lo que nos permite decir que sus tipos de dispositivo son exactamente dos. Verificado por nosotros en la fuente primaria

Fuente · consultado el 2026-08-25

Política de privacidad

No hay política de privacidad, y aquí eso no es una carencia: no existe ningún servicio detrás del programa ni responsable del tratamiento a quien exigírsela. sin verificar

Cobertura

Qué ejecuta y dónde

Plataformas, aceleradores y formatos de modelo: los tres muros con los que se choca la primera noche, y los que nadie escribe hasta haberse chocado.

Dónde funciona

Soporte por plataforma, una fila por plataforma
Plataforma Soporte Evidencia
Windows Parcial y sin documentar. El framework mlx publica ruedas oficiales de Windows (x64 y ARM64) desde julio de 2026 y las prueba en su integración continua, pero su documentación no menciona Windows en ninguna parte, y mlx-lm declara su dependencia solo para macOS: fuera de macOS, `pip install mlx-lm` no instala el motor. Que mlx-lm funcione en Windows no está verificado. verificado por nosotros
macOS Apple Silicon Sí, es su plataforma. macOS 14.0 o superior para instalar; algunas funciones de modelos grandes exigen macOS 15. verificado por nosotros
macOS Intel No. Todas las ruedas de macOS son arm64; no existe ninguna x86_64. Ojo con ejecutar Python bajo Rosetta: su propia guía avisa de ese caso. verificado por nosotros
Linux Sí para el framework mlx, que tiene backend CUDA y versión de solo CPU. Que mlx-lm funcione bien ahí no lo hemos verificado: su README solo habla de Apple Silicon. declarado por el fabricante

Qué acelera

Aceleradores de hardware y su estado
Motor Estado Evidencia
Metal Sí: es el camino nativo en Apple Silicon, con memoria unificada: CPU y GPU comparten el mismo banco sin copiar datos entre ellos. declarado por el fabricante
CUDA Sí, en el framework mlx sobre Linux, exigiendo arquitectura NVIDIA SM 7.5 o superior. declarado por el fabricante
CPU Sí. Es uno de los dos únicos tipos de dispositivo que existen en MLX. verificado por nosotros
ROCm No lo hemos podido verificar. Su documentación de instalación solo ofrece Apple Silicon, CUDA y CPU, pero en ninguna parte declaran que AMD no esté soportado, así que reportamos la ausencia y no un «no». sin verificar
Vulkan No lo hemos podido verificar. No aparece en la documentación ni en el árbol de backends, y no hay declaración en ningún sentido. sin verificar
Neural Engine No, y esta es una ausencia verificada y no una fuente que falta: el enumerado de tipos de dispositivo del código tiene exactamente dos valores, cpu y gpu, y la documentación pública lo dice igual. Mucha gente supone que MLX usa el Neural Engine. No lo usa. verificado por nosotros

«Currently supported device types are the CPU and GPU.»

Formatos de modelo que ejecuta

Formato MLX y safetensors de Hugging Face. No puede ejecutar un GGUF. Solo sabe exportar a GGUF tras fusionar un adaptador, y aun así solo para modelos estilo Mistral, Mixtral y Llama en fp16. verificado por nosotros

Fuente · consultado el 2026-08-25

Convivir

Instalarlo y convivir con él

Cuántos pasos hasta el primer token, qué deja en tu disco, bajo qué licencia y a qué ritmo cambia por debajo.

Pasos hasta el primer token

2 pasos. Instalar el paquete y ejecutar mlx_lm.generate o mlx_lm.chat: descarga el modelo por defecto y responde. declarado por el fabricante

Qué escribe en tu disco

Qué escribe este programa en tu disco y dónde
Qué Dónde Evidencia
Modelos: la caché de Hugging Face ~/.cache/huggingface/hub — la caché de Hugging Face (HF_HOME · HF_HUB_CACHE) declarado por el fabricante
Historial de conversaciones: no se guarda. El contexto vive en memoria y se pierde al salir. Es el único de los cinco que no deja rastro de tus conversaciones en disco En ningún sitio: no se escribe nada verificado por nosotros
Fichero de calibración de cuantización: solo se crea si cuantizas con AWQ, DWQ o GPTQ ~/.cache/mlx-lm/ verificado por nosotros

Licencia

MIT, de Apple Inc. Tanto el framework como mlx-lm. verificado por nosotros

Fuente · consultado el 2026-08-25

Versión y ritmo de publicación

Históricamente una versión cada una a tres semanas, pero la publicación lleva parada desde el 22 de abril de 2026 aunque el desarrollo continúa a diario. El framework mlx sí publica: unas dieciséis versiones al año. verificado por nosotros

Fuente · consultado el 2026-08-25

Avisos

Lo que conviene saber antes de instalarlo

  • El paquete que instala la gente lleva cuatro meses congelado. `pip install mlx-lm` da hoy la versión 0.31.3 del 22 de abril de 2026, mientras el repositorio recibe commits a diario y su fichero de versión ya marca 0.32.0. Los modelos añadidos desde abril solo están si instalas desde el repositorio. No hay ningún anuncio primario que lo explique: constatamos el hecho, no el motivo.
  • MLX no usa el Neural Engine. Los tipos de dispositivo que existen en su código son exactamente dos: CPU y GPU.
  • No ejecuta GGUF. Si tu colección de modelos es GGUF, MLX no te sirve sin reconvertirlos.
  • El servidor escucha en localhost pero con el CORS abierto de par en par y sin ninguna autenticación, y su propia documentación advierte de que no es para producción. Esa advertencia no viaja dentro del paquete de PyPI.
  • Es el único de los cinco que no guarda las conversaciones en disco.