「LFM2.5-350M-Diffusion-Exp」ブロック拡散型の軽量言語モデル:必要VRAM 4GB〜

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | LiquidAI/LFM2.5-350M-Diffusion-Exp |
| 公開元のまとめ | Liquid AI のモデルとライセンスのまとめ |
| 公開日 | 2026-10-03 |
| ライセンス | lfm1.0 |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(公式HuggingFaceリポジトリからの直接出典) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
当サイトで確かめたこと
- 同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。
詳しい値と条件は、下の「当サイトでの実測」の節にあります。
概要
LiquidAIは、同社の軽量LLM「LFM2.5-350M」を均一状態のブロック拡散(block-diffusion)モデルへと変換した実験的モデル「LFM2.5-350M-Diffusion-Exp」を公開しました。本モデルは、従来の自己回帰型モデルのように1回のフォワードパスで1トークンずつ出力するのではなく、32トークンのブロックを並列にデノイズ(ノイズ除去)する手法を採用しています。これにより、デノイズのステップ数と引き換えに、バッチサイズが小さい環境下において親モデルよりも高速なデコード速度を実現しています。
1ブロックあたり8ステップのデノイズ設定(NFE 8)においては、ほとんどのベンチマークで元の自己回帰型モデルである「LFM2.5-350M」と同等、またはそれに非常に近い性能を維持していると報告されています。バックボーンには、LFM2.5と同じ「ショート畳み込み+アテンション」のハイブリッドアーキテクチャ、トークナイザー、およびチャットテンプレートがそのまま使用されています。
本モデルのライセンスは「lfm1.0」となっており、詳細な情報はHugging Faceのモデルページで確認できます。
スペック
本モデルのスペックは以下の通りです。
- パラメータ数:350M
- レイヤー数:16(10 short-convolution + 6 GQA、adaLNノイズ条件付け、自己条件付け)
- ブロックサイズ:32トークン(ブロック内は双方向、ブロック間は因果的)
- トレーニング:800B プリトレーニング + 600B ミッドトレーニング + 150B SFTトークン、その後ポストトレーニングとステップ蒸留
- ボキャブラリ:65,536(64,400サンプリング)
性能
以下は、公開元のモデルカードに掲載されている、本モデルと他の軽量モデルとの性能比較表です。なお、「NFE」は32トークンブロックあたりのデノイズステップ数を表しています。
→ 横にスクロールできます
| Benchmark | NFE 32 | NFE 8 | NFE 4 | LFM2.5-350M | Granite 4.0 H-350M | Qwen3.5-0.8B | Granite 4.0 H-1B |
|---|---|---|---|---|---|---|---|
| GPQA Diamond | 32.8 | 32.5 | 32.8 | 29.8 | 23.7 | 23.8 | 22.9 |
| MMLU-Pro | 18.6 | 19.6 | 17.6 | 21.8 | 10.8 | 40.6 | 23.6 |
| CaseReportBench | 45.5 | 37.2 | 13.3 | 37.6 | 30.2 | 36.5 | 35.4 |
| IFEval | 81.1 | 75.7 | 69.0 | 77.2 | 59.9 | 64.0 | 77.9 |
| Multi-IF | 50.1 | 46.7 | 40.3 | 45.3 | 26.9 | 41.0 | 47.5 |
| IFBench | 34.1 | 33.6 | 32.3 | 38.3 | 19.3 | 23.6 | 25.5 |
| BFCL v4 | 18.7 | 17.4 | 14.4 | 22.0 | 13.2 | 20.0 | 27.9 |
| BFCL v3 | 38.1 | 35.2 | 29.8 | 44.4 | 27.5 | 38.2 | 49.5 |
| τ²-Bench Telecom | 12.3 | 11.4 | 10.5 | 13.2 | 4.4 | 61.4 | 14.9 |
公開元の測定結果によると、本モデルは物理・化学・生物の博士課程レベルの問題を扱う科学の難問ベンチマーク「GPQA Diamond」において、NFE 32で32.8、NFE 8で32.5という高いスコアを記録しています。これは、自己回帰型の元モデルであるLFM2.5-350M(29.8)だけでなく、よりパラメータ数の多いQwen3.5-0.8B(23.8)やGranite 4.0 H-1B(22.9)をも上回る優秀な結果です。また、形式的な指示への追従能力を測る「IFEval」でも、NFE 32において81.1を記録し、比較対象の中で最も高い数値を示しています。
一方で、一般知識や推論能力を測る「MMLU-Pro」では、本モデルのスコアはNFE 32で18.6、NFE 8で19.6にとどまり、Qwen3.5-0.8B(40.6)やGranite 4.0 H-1B(23.6)に及んでいません。さらに、関数の選択や引数の組み立ての正確さを測るエージェント向け指標「BFCL v3」および「BFCL v4」においても、元モデルやQwen3.5-0.8B、Granite 4.0 H-1Bを下回る結果となっています。
デノイズのステップ数(NFE)を減らすことによる影響については、NFE 32からNFE 8への削減では多くのベンチマークで性能低下がわずかに抑えられているものの、最速設定であるNFE 4まで減らすと「CaseReportBench」のスコアが45.5から13.3へと急落するなど、特定のタスクで大幅な性能劣化が見られます。用途に応じて、速度と精度のバランスを考慮した設定の選択が必要です。
得意なこと・想定用途
本モデルは、350Mパラメータという極めてコンパクトなサイズでありながら、ブロック拡散(block-diffusion)方式による高速なテキスト生成を実現するエッジ向け・対話向けのモデルです。
元モデルである「LFM2.5-350M」の設計思想に基づき、主にデータ抽出や構造化出力、ツール利用(Function Calling)といった軽量な自動化タスクやデバイス上での対話処理に向いています。一方で、公開元のモデルカードでは、知識集約的なタスクやプログラミング用途には推奨されない旨が明記されています。
本モデルの最大の特徴は、推論時のデノイズステップ数(NFE)を切り替えることで、速度と出力品質のトレードオフを柔軟に調整できる点です。公開元が提供しているデコード設定は以下の3種類です。
| Decode config | Steps per block | Use |
|---|---|---|
decode_configs/nfe32.yaml |
32 | Highest quality |
decode_configs/nfe8.yaml |
8 | Recommended |
decode_configs/nfe4.yaml |
4 | Fastest |
実用上は、1ブロックあたり8ステップで処理を行う「NFE 8」が推奨設定とされており、自己回帰型の元モデルと同等の品質を保ちながら高速なデコードを活用できます。より高い出力精度が求められる場面では32ステップの「NFE 32」を、品質よりも極限の処理速度を優先する場面では4ステップの「NFE 4」を選択するといった使い分けが可能です。
なお、生成時のサンプリングには温度を0.8から0.4へと徐々に下げるアニーリング(temperature anneal)を用いた祖先サンプリング(ancestral sampling)が指定されており、貪欲法(greedy decoding)によるデコードは非推奨とされています。
対応言語については、元モデルのLFM2.5-350Mにおいて英語、アラビア語、中国語、フランス語、ドイツ語、日本語、韓国語、ポルトガル語、スペイン語の多言語がカバーされています。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 425M
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 4GB(ノートPCの内蔵GPU・スマートフォンなど) | BF16 | 0.8GB | 0.9GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-10-05 時点): llama.cpp: 未登録、vLLM: 未登録、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません。
公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。現時点で動かすなら transformers(PyTorch) で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス lfm1.0(条件付きで商用利用可): LiquidAI の LFM Open License v1.0 です。商用利用は可能ですが、年間売上が1,000万ドル以上の法人による商用利用は許諾の対象外です(第5条)。再配布時はライセンス文と変更点の告知が必要です。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
当サイトでの実測
当サイトのサーバー(GPUなし)で、このモデルのファイルを実際に読み込み・動かして確かめた値です。モデルカードの記載ではなく、当サイトが測った結果です。測り方と全モデルの一覧は観測データにまとめています。
日本語のトークン効率
| トークナイザ | 日本語1,000字あたりのトークン数 | 同じ内容の英文との比 |
|---|---|---|
| このモデル | 686 | 1.22倍 |
| Qwen3 | 688 | 1.26倍 |
| Llama 3.2 | 744 | 1.36倍 |
| Gemma 3 | 564 | 1.03倍 |
| gpt-oss | 795 | 1.45倍 |
| LLM-jp-3 | 497 | 0.85倍 |
同じ日本語を表すのに要るトークン数は、Qwen3 のトークナイザとほぼ同じです。
LiquidAI/LFM2.5-350M-Base の tokenizer.json で、当サイトが書き下ろした固定の文章(876字。ニュース・会話・技術文書・敬語のメール・紀行文・料理の6種)と、同じ内容の英文を数えました。トークン数が少ないほど、同じ文脈長に長い日本語が入ります。
同クラスの既報モデル
当サイトが最近取り上げた、パラメータ数 〜4B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。
→ 横にスクロールできます
| モデル | パラメータ数 | 最小のVRAM階層 | ライセンス | 記事 |
|---|---|---|---|---|
| togethercomputer/Tev1-0.8B-experimental | 873M | 4GB | — | 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜(2026-09-25) |
| pfnet/plamo-3-610m-fin-instruct | 890M | 4GB | plamo-community-license | 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜(2026-09-24) |
| harshatheg/Qwen-2.5-1B-RLCD | 1.5B | 4GB | apache-2.0 | 「Qwen-2.5-1B-RLCD」並列制約付きデコーディングのテキスト生成モデル:必要VRAM 4GB〜(2026-09-16) |
| tencent/Simple-Attention-Sparsification | 4.0B | 12GB | — | 「Simple-Attention-Sparsification」テキスト生成モデル:必要VRAM 12GB〜(2026-09-14) |
| openbmb/MiniCPM5-2B | 2.5B | 4GB | apache-2.0 | 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:当サイトでの回答例・必要VRAM 4GB〜(2026-09-07) |
入手方法
本モデルはHugging Face上にて「safetensors」形式で公開されており、利用許諾への事前同意が不要なオープンな状態で提供されています。
推論用の専用コード、SGLangによるサービングスクリプト、および評価用ツールは、公式リポジトリ「Liquid4All/lfm-diffusion」にて公開されています。
Python環境からは、専用ライブラリ lfm_diffusion を用いて以下のようにモデルを読み込み、推論を実行できます。
from lfm_diffusion import generate, load_model
model, tokenizer = load_model("LiquidAI/lfm2.5-350m-diffusion-exp")
messages = [{"role": "user", "content": "Give three tips for getting better sleep."}]
print(generate(model, tokenizer, messages, config="nfe8", max_new_tokens=256))
同じ用途の既報モデル
当サイトが取り上げたテキスト生成のモデルを新しい順に並べています。用途は配布元がHugging Faceに付けたタスク(pipeline_tag)から機械的に分けたもので、最小のVRAM階層は当サイトの概算です。
- 推論モデル「ELYZA-Thinking-1.0」の32B/33Bモデル公開(32.1B・80GB)
- 「OrcaSAQ-2-27B」テキスト生成モデル:当サイトでの回答例・必要VRAM 16GB〜(27.8B・16GB)
- 「Hemmingway-1」日常文章特化の言語モデル:必要VRAM 12GB〜・GGUF版あり(26.9B・12GB)
- 「Xing4.0-29B-A4B」テキスト生成モデル:当サイトでの回答例・必要VRAM 24GB〜(31.2B・24GB)
次に読むなら
- GPUのVRAMから探す(このモデルは4GBの階層から動きます) → 8GBのGPUで動くほかのモデル
- このモデルを入手できる形式を調べる → Safetensors形式の解説と対応モデル
- 公開元について調べる → Liquid AI のモデル・ライセンス・記事のまとめ
- 記事に出てくる GPQA Diamond・MMLU-Pro・IFEval の読み方を知る → ベンチマーク用語集
出典
- LiquidAI/LFM2.5-350M-Diffusion-Exp (Hugging Face)
- LiquidAI/LFM2.5-350M (Hugging Face)
- Liquid4All/lfm-diffusion (GitHub)
更新履歴
- 2026-10-05: 当サイトでの実測(日本語のトークン効率)を追加しました。

