「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり

「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり

基本情報

項目 内容
リポジトリ LiquidAI/LFM2.5-VL-3B-DSpark
まとめページ LFM2.5-VL のまとめ(記事1本)
公開日 2026-09-18
配布形式 safetensors
論文 arXiv:2603.14989
出典の種類 公開元の一次情報(Hugging Face公式ブログのLiquidAIチーム記事)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

LiquidAIは、同社のビジョン言語モデル(VLM)である「LFM2.5-VL-3B」向けの実験的なDSparkドラフトモデル「LFM2.5-VL-DSpark」(リポジトリ名:LFM2.5-VL-3B-DSpark)をHugging Face Blogにて公開しました。本モデルは、ターゲットモデルに投機的デコード(Speculative Decoding)を適用するためのドラフトモデルです。メモリ使用量の増加を最小限に抑えつつ、出力品質を一切損なうことなく推論速度を大幅に向上させることを目指して開発されました。デコード速度はデバイス上で最大3.13倍、H100上で最大2.66倍向上し、エンドツーエンドのレイテンシでもそれぞれ最大2.62倍、2.27倍の高速化を達成しています。

スペック

公開されたドラフトモデルのスペックおよび構成は以下の通りです。資料に記載されている構成パーツごとのパラメータ数もあわせて示します。

  • 総パラメータ数: 約280M(279.5M、ターゲットモデルである3Bの約8.9%に相当)
  • アーキテクチャ: アテンションのみで構成された4レイヤーの簡易ドラフトモデル(attention-only drafter)
  • ブロックサイズ: 9(推論時はハードウェアに応じて8または9を推奨)
  • コンポーネント内訳:
  • デコーダースタック(4レイヤー): 193.0M – 隠れ状態プロジェクション(Hidden-state projection): 21.0M – マルコフヘッド(Markov head): 65.5M – LayerNorms + コンフィデンスヘッド: 6.4k

本モデルは、テキスト用のLFM2.5-DSparkドラフトモデルと同様のアーキテクチャを採用しています。ターゲットモデルの特定のレイヤーから隠れ状態をキャプチャし、それを条件としてk個の候補トークンをドラフトします。画像パッチとテキストトークンは、これらのレイヤーの手前で共有表現に投影されるため、入力モダリティに関係なく同一次元の隠れ状態ベクトルとして処理されます。

性能

公開元であるLiquidAIが自ら公表した測定結果によると、本ドラフトモデルを適用することで、CPUおよびGPU環境の双方において顕著な高速化が確認されています。

評価は、一般VQA、テキストVQA、画像キャプション、チャートVQA、複雑な推論、マルチターン会話の6つの多様なビジョンタスクを含む「MMSpec」ベンチマークを用いて行われました。測定結果は以下の通りです。

オンデバイス推論(Apple Silicon)

  • M5 Max(MLX-VLMを使用、ブロックサイズ8):
  • デコード速度: タスクごとに2.30倍〜3.13倍高速化 – エンドツーエンドのレイテンシ: 1.56倍〜2.62倍向上
  • M3 Ultra(llama.cppを使用、ブロックサイズ8):
  • デコード速度: 1.57倍〜2.14倍高速化 – エンドツーエンドのレイテンシ: 1.30倍〜1.77倍向上

GPU推論

  • NVIDIA H100(SGLangを使用、ブロックサイズ8):
  • デコード速度: 20.4倍〜2.66倍高速化(※原文の「20.4x to 2.66x」という表記に基づく) – エンドツーエンドのレイテンシ: 1.64倍〜2.27倍向上

性能評価と制限事項

これらの測定結果から、本モデルは特にApple Silicon(M5 MaxやM3 Ultra)を搭載したエッジデバイスや、H100などのハイエンドGPU環境において、デコード処理を大幅に高速化できることが示されています。

一方で、ビジョン言語モデル(VLM)特有の制限事項も報告されています。投機的デコードは「デコード(生成)ステージ」のみを高速化する技術であり、画像エンコーダーによる処理やプレフィル(prefill)ステージは高速化できません。VLMでは、画像がビジョンエンコーダーを通過した後に、言語バックボーンが数百ものビジュアルトークンとテキストプロンプトを処理するため、プレフィルがエンドツーエンドのレイテンシにおいて大きな割合を占めます。アムダールの法則が示す通り、高速化されないプレフィル部分がボトルネックとなるため、デコード速度が最大3倍以上に向上しても、エンドツーエンドでの全体の向上幅は控えめな数値(1.30倍〜2.62倍程度)に留まる点に留意する必要があります。

得意なこと・想定用途

「LFM2.5-VL-DSpark」は、ターゲットモデルであるビジョン言語モデル「LFM2.5-VL-3B」のデコード(テキスト生成)段階を高速化するために開発されたドラフトモデルです。

具体的には、画像キャプションの生成、一般VQA(視覚的質問応答)、テキストVQA、チャート解釈(チャートVQA)、高度なマルチステップ推論、マルチターン対話など、画像とテキストを組み合わせた多様なビジョンタスクにおいて、モデルの出力品質を維持したまま推論速度を向上させます。

本モデルはオープンウェイトとして公開されており、制限なくダウンロード、ファインチューニング、デプロイが可能です。特に、Macなどのエッジデバイス(Apple Silicon環境)からデータセンター向けのH100 GPUまで、幅広い環境でビジョン言語モデルをより高速に運用したいユースケースに適しています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 279M

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
4GB(ノートPCの内蔵GPU・スマートフォンなど) F16 0.5GB 0.6GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-24 時点): llama.cpp: 登録あり、vLLM: 未登録、MLX (mlx-lm): 登録あり。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 LiquidAI/LFM2.5-VL-3B-DSpark-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

本モデルはHugging FaceにてSafetensorsおよびGGUFの各形式で配布されています。SGLang、llama.cpp、MLX-VLMの各推論エンジンにおいてデイワン(公開初日)からサポートされています。

それぞれのエンジンでの実行手順とコマンド例は以下の通りです。

SGLangでの実行

DSparkサポートが含まれるSGLangのビルドを使用し、以下のコマンドでサーバーを起動します。

python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache

起動後は http://localhost:30000/v1 でOpenAI互換のエンドポイント経由でクエリを送信できます。

llama.cppでの実行

DSparkに対応したllama.cppのビルドを用い、llama-server コマンドでターゲットモデルとドラフトモデル(-md)を読み込みます。

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
-fa on -ngl 99 -c 8192

MLX-VLMでの実行

MLX-VLMに対応したビルド環境で、mlx_vlm.server コマンドにターゲットモデルとドラフトモデルを指定して実行します。

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

なお、本ドラフトモデルによる投機的デコードはターゲットモデル側ですべての提案トークンを検証するため、出力品質はターゲットモデル単体で実行した場合と完全に同一になります。

派生版・量子化版

→ 横にスクロールできます

追記日 配布元 形式 リポジトリ 最小のVRAM階層(量子化・必要メモリの目安)
2026-09-25 LiquidAI GGUF LiquidAI/LFM2.5-VL-3B-DSpark-GGUF F16 0.6GB(4GB VRAMで動作)

各リポジトリの量子化とファイルサイズ:

  • LiquidAI/LFM2.5-VL-3B-DSpark-GGUF の量子化: F16 0.5GB

このほか、上記以外の投稿者による変換版が 2 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。

この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。

関連記事

次に読むなら

出典

更新履歴

  • 2026-09-25: 変換版を「派生版・量子化版」に追記しました: LiquidAI/LFM2.5-VL-3B-DSpark-GGUF
  • 2026-09-25: 動作環境の表を LiquidAI/LFM2.5-VL-3B-DSpark-GGUF の実ファイルサイズで更新しました。
  • 2026-09-25: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。