MLX形式とは:対応エンジンと入手できるモデルまとめ

MLX とは

MLX は、Apple の機械学習研究チームが開発した、Apple Silicon(M シリーズのチップ)向けの機械学習フレームワークです。LLM を動かすためのパッケージ mlx-lm があり、Hugging Face では MLX 用に変換・量子化したモデル(mlx-community の組織など)が数多く配られています。当サイトで「MLX 形式」と呼んでいるのは、この MLX で読み込むための重みのことです。

何がうれしいのか

  • Mac のユニファイドメモリをそのまま使えます。 Apple Silicon は CPU と GPU が同じメモリを共有するので、メモリの多い Mac なら、家庭用の GPU には載らない大きさのモデルも動かせます。
  • Apple Silicon に合わせて最適化されています。 同じ Mac で GGUF(llama.cpp)と比べて、生成が速くなる場合があります。どちらが速いかはモデルや量子化によって変わります。
  • 4bit・8bit などの量子化版がそろっています。 リポジトリ名の末尾の -4bit -8bit が量子化の程度を表します。

手元で動かすときのポイント

  • Mac(Apple Silicon)専用です。 Windows・Linux の NVIDIA GPU では使えません。その場合は GGUF や AWQ を選びます。
  • LM Studio は MLX のモデルをそのまま読み込めます。 コマンドラインなら pip install mlx-lm の後、mlx_lm.generate や mlx_lm.server で動かせます。
  • メモリの全部を GPU に使えるわけではありません。 macOS が GPU に割り当てるメモリには上限があるので、搭載メモリぎりぎりの大きさのモデルは避け、余裕を見て選びます。
  • ファイルの拡張子は .safetensors です。 中身が MLX 用かどうかは、リポジトリの名前やタグ(mlx)で見分けます。

出典: ml-explore/mlx の README、ml-explore/mlx-lm の README、Hugging Face の mlx-community の組織(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、MLX形式で入手できるモデルの記事を6本公開しています(記事のリポジトリ自体がMLX形式のもの2本、そのモデルのMLX版を確認したもの4本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもMLX版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
exo 手元の複数デバイス(Mac・PC・スマートフォン)をつないで1つのモデルを分散実行するフレームワーク。

MLX形式で入手できるモデル

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-26(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。