「LFM2.5-350M-Diffusion-Exp」ブロック拡散型の軽量言語モデル:必要VRAM 4GB〜

2026年10月5日

「LFM2.5-350M-Diffusion-Exp」ブロック拡散型の軽量言語モデル:必要VRAM 4GB〜

基本情報

項目 内容
リポジトリ LiquidAI/LFM2.5-350M-Diffusion-Exp
公開元のまとめ Liquid AI のモデルとライセンスのまとめ
公開日 2026-10-03
ライセンス lfm1.0
配布形式 safetensors
出典の種類 公開元の一次情報(公式HuggingFaceリポジトリからの直接出典)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

当サイトで確かめたこと

  • 同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。

詳しい値と条件は、下の「当サイトでの実測」の節にあります。

概要

LiquidAIは、同社の軽量LLM「LFM2.5-350M」を均一状態のブロック拡散(block-diffusion)モデルへと変換した実験的モデル「LFM2.5-350M-Diffusion-Exp」を公開しました。本モデルは、従来の自己回帰型モデルのように1回のフォワードパスで1トークンずつ出力するのではなく、32トークンのブロックを並列にデノイズ(ノイズ除去)する手法を採用しています。これにより、デノイズのステップ数と引き換えに、バッチサイズが小さい環境下において親モデルよりも高速なデコード速度を実現しています。

1ブロックあたり8ステップのデノイズ設定(NFE 8)においては、ほとんどのベンチマークで元の自己回帰型モデルである「LFM2.5-350M」と同等、またはそれに非常に近い性能を維持していると報告されています。バックボーンには、LFM2.5と同じ「ショート畳み込み+アテンション」のハイブリッドアーキテクチャ、トークナイザー、およびチャットテンプレートがそのまま使用されています。

本モデルのライセンスは「lfm1.0」となっており、詳細な情報はHugging Faceのモデルページで確認できます。

スペック

本モデルのスペックは以下の通りです。

  • パラメータ数:350M
  • レイヤー数:16(10 short-convolution + 6 GQA、adaLNノイズ条件付け、自己条件付け)
  • ブロックサイズ:32トークン(ブロック内は双方向、ブロック間は因果的)
  • トレーニング:800B プリトレーニング + 600B ミッドトレーニング + 150B SFTトークン、その後ポストトレーニングとステップ蒸留
  • ボキャブラリ:65,536(64,400サンプリング)

性能

以下は、公開元のモデルカードに掲載されている、本モデルと他の軽量モデルとの性能比較表です。なお、「NFE」は32トークンブロックあたりのデノイズステップ数を表しています。

→ 横にスクロールできます

Benchmark NFE 32 NFE 8 NFE 4 LFM2.5-350M Granite 4.0 H-350M Qwen3.5-0.8B Granite 4.0 H-1B
GPQA Diamond 32.8 32.5 32.8 29.8 23.7 23.8 22.9
MMLU-Pro 18.6 19.6 17.6 21.8 10.8 40.6 23.6
CaseReportBench 45.5 37.2 13.3 37.6 30.2 36.5 35.4
IFEval 81.1 75.7 69.0 77.2 59.9 64.0 77.9
Multi-IF 50.1 46.7 40.3 45.3 26.9 41.0 47.5
IFBench 34.1 33.6 32.3 38.3 19.3 23.6 25.5
BFCL v4 18.7 17.4 14.4 22.0 13.2 20.0 27.9
BFCL v3 38.1 35.2 29.8 44.4 27.5 38.2 49.5
τ²-Bench Telecom 12.3 11.4 10.5 13.2 4.4 61.4 14.9

公開元の測定結果によると、本モデルは物理・化学・生物の博士課程レベルの問題を扱う科学の難問ベンチマーク「GPQA Diamond」において、NFE 32で32.8、NFE 8で32.5という高いスコアを記録しています。これは、自己回帰型の元モデルであるLFM2.5-350M(29.8)だけでなく、よりパラメータ数の多いQwen3.5-0.8B(23.8)やGranite 4.0 H-1B(22.9)をも上回る優秀な結果です。また、形式的な指示への追従能力を測る「IFEval」でも、NFE 32において81.1を記録し、比較対象の中で最も高い数値を示しています。

一方で、一般知識や推論能力を測る「MMLU-Pro」では、本モデルのスコアはNFE 32で18.6、NFE 8で19.6にとどまり、Qwen3.5-0.8B(40.6)やGranite 4.0 H-1B(23.6)に及んでいません。さらに、関数の選択や引数の組み立ての正確さを測るエージェント向け指標「BFCL v3」および「BFCL v4」においても、元モデルやQwen3.5-0.8B、Granite 4.0 H-1Bを下回る結果となっています。

デノイズのステップ数(NFE)を減らすことによる影響については、NFE 32からNFE 8への削減では多くのベンチマークで性能低下がわずかに抑えられているものの、最速設定であるNFE 4まで減らすと「CaseReportBench」のスコアが45.5から13.3へと急落するなど、特定のタスクで大幅な性能劣化が見られます。用途に応じて、速度と精度のバランスを考慮した設定の選択が必要です。

得意なこと・想定用途

本モデルは、350Mパラメータという極めてコンパクトなサイズでありながら、ブロック拡散(block-diffusion)方式による高速なテキスト生成を実現するエッジ向け・対話向けのモデルです。

元モデルである「LFM2.5-350M」の設計思想に基づき、主にデータ抽出や構造化出力、ツール利用(Function Calling)といった軽量な自動化タスクやデバイス上での対話処理に向いています。一方で、公開元のモデルカードでは、知識集約的なタスクやプログラミング用途には推奨されない旨が明記されています。

本モデルの最大の特徴は、推論時のデノイズステップ数(NFE)を切り替えることで、速度と出力品質のトレードオフを柔軟に調整できる点です。公開元が提供しているデコード設定は以下の3種類です。

Decode config Steps per block Use
decode_configs/nfe32.yaml 32 Highest quality
decode_configs/nfe8.yaml 8 Recommended
decode_configs/nfe4.yaml 4 Fastest

実用上は、1ブロックあたり8ステップで処理を行う「NFE 8」が推奨設定とされており、自己回帰型の元モデルと同等の品質を保ちながら高速なデコードを活用できます。より高い出力精度が求められる場面では32ステップの「NFE 32」を、品質よりも極限の処理速度を優先する場面では4ステップの「NFE 4」を選択するといった使い分けが可能です。

なお、生成時のサンプリングには温度を0.8から0.4へと徐々に下げるアニーリング(temperature anneal)を用いた祖先サンプリング(ancestral sampling)が指定されており、貪欲法(greedy decoding)によるデコードは非推奨とされています。

対応言語については、元モデルのLFM2.5-350Mにおいて英語、アラビア語、中国語、フランス語、ドイツ語、日本語、韓国語、ポルトガル語、スペイン語の多言語がカバーされています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 425M

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
4GB(ノートPCの内蔵GPU・スマートフォンなど) BF16 0.8GB 0.9GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-05 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

現時点では Ollama・LM Studio・llama.cpp で動かせません。

公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。現時点で動かすなら transformers(PyTorch) で読み込む形になり、必要メモリは上の表のとおりです。

ライセンス lfm1.0(条件付きで商用利用可): LiquidAI の LFM Open License v1.0 です。商用利用は可能ですが、年間売上が1,000万ドル以上の法人による商用利用は許諾の対象外です(第5条)。再配布時はライセンス文と変更点の告知が必要です。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。

日本語のトークン効率

トークナイザ 日本語1,000字あたりのトークン数 同じ内容の英文との比
このモデル 686 1.22倍
Qwen3 688 1.26倍
Llama 3.2 744 1.36倍
Gemma 3 564 1.03倍
gpt-oss 795 1.45倍
LLM-jp-3 497 0.85倍

同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。

LiquidAI/LFM2.5-350M-Base の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 〜4B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
togethercomputer/Tev1-0.8B-experimental 873M 4GB — 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜(2026-09-25)
pfnet/plamo-3-610m-fin-instruct 890M 4GB plamo-community-license 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜(2026-09-24)
harshatheg/Qwen-2.5-1B-RLCD 1.5B 4GB apache-2.0 「Qwen-2.5-1B-RLCD」並列制約付きデコーディングのテキスト生成モデル:必要VRAM 4GB〜(2026-09-16)
tencent/Simple-Attention-Sparsification 4.0B 12GB — 「Simple-Attention-Sparsification」テキスト生成モデル:必要VRAM 12GB〜(2026-09-14)
openbmb/MiniCPM5-2B 2.5B 4GB apache-2.0 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:当サイトでの回答例・必要VRAM 4GB〜(2026-09-07)

入手方法

本モデルはHugging Face上にて「safetensors」形式で公開されており、利用許諾への事前同意が不要なオープンな状態で提供されています。

推論用の専用コード、SGLangによるサービングスクリプト、および評価用ツールは、公式リポジトリ「Liquid4All/lfm-diffusion」にて公開されています。

Python環境からは、専用ライブラリ lfm_diffusion を用いて以下のようにモデルを読み込み、推論を実行できます。

from lfm_diffusion import generate, load_model

model, tokenizer = load_model("LiquidAI/lfm2.5-350m-diffusion-exp")
messages = [{"role": "user", "content": "Give three tips for getting better sleep."}]
print(generate(model, tokenizer, messages, config="nfe8", max_new_tokens=256))

同じ用途の既報モデル

当サイトが取り上げたテキスト生成のモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。

テキスト生成のモデルをすべて見る →

次に読むなら

出典

更新履歴

  • 2026-10-05: 当サイトでの実測(日本語のトークン効率)を追加しました。