Safetensors形式とは:対応エンジンと入手できるモデルまとめ

Safetensors とは

Safetensors は、Hugging Face が開発した、モデルの重み(テンソル)を保存するためのファイル形式です。Hugging Face で公開されるモデルの大半は、公開元が学習した重みをこの形式(拡張子 .safetensors)で配っています。いわばモデルの「原本」が入っている形式です。

何がうれしいのか

  • 読み込んでもコードが実行されません。 以前よく使われた PyTorch の .bin(pickle)形式は、読み込むときに任意のコードを実行できてしまう危険がありました。Safetensors は重みの数値と最小限のヘッダーだけを持つので、この危険がありません。
  • 読み込みが速く、必要な部分だけ読めます。 ファイルをメモリにそのまま対応付けて(メモリマップ)読むので、大きなモデルでも起動が速く、複数の GPU に分けて載せるときも必要なテンソルだけを読めます。
  • 多くのツールの共通の入り口です。 Transformers・Diffusers・vLLM・SGLang などがそのまま読み込み、GGUF・MLX・AWQ などへの変換も、ほとんどがこの形式から始まります。

手元で動かすときのポイント

  • 元の精度(BF16 / FP16)のままだと、必要メモリが大きくなります。 パラメータ数のおよそ2倍のバイト数が要ります(例えば 8B のモデルで約16GB)。家庭用の GPU で大きなモデルを動かすなら、GGUF や AWQ などの量子化版を探すのが現実的です。
  • FP8・NVFP4 のような低い精度の Safetensors もあります。 これらは主に vLLM・SGLang などのサーバー向けエンジンで、対応する世代の NVIDIA GPU を使って動かします。
  • Ollama・LM Studio(llama.cpp 系)では、そのままは読み込めません。 GGUF へ変換された版を使います。
  • 画像・動画の生成モデルも多くはこの形式です。 ComfyUI・Diffusers で使うモデルの配置は、各記事の「配布ファイル」の節を参照してください。
  • 下の一覧のうち、MLX・AWQ・GPTQ・EXL のリポジトリも拡張子は .safetensors ですが、それぞれの形式のページに載せています。

出典: Safetensors のドキュメント(Hugging Face)、huggingface/safetensors の README(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、Safetensors形式で入手できるモデルの記事を29本公開しています(記事のリポジトリ自体がSafetensors形式のもの29本、そのモデルのSafetensors版を確認したもの0本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもSafetensors版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
vLLM PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。
SGLang RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。
Diffusers Hugging Face の拡散モデル用Pythonライブラリ。画像・動画・音声の生成モデルをコードから扱う際の標準。

Safetensors形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-27 XiaomiMiMo/MiMo-V2.6-Pro-RL このリポジトリ — — XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル
2026-09-26 MiniMaxAI/MiniMax-H3 このリポジトリ — 32GB 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧
2026-09-26 deepseek-ai/DeepSeek-V4-Pro-0813 このリポジトリ — — 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB
2026-09-26 Qwen/Qwen3.8-27B このリポジトリ — 8GB 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
2026-09-26 togethercomputer/Tev1-0.8B-experimental このリポジトリ — 4GB 「Tev1-0.8B-experimental」構造化データの選択肢選定に特化した意思決定モデル:必要VRAM 4GB〜
2026-09-25 LiquidAI/LFM2.5-VL-3B-DSpark このリポジトリ — 4GB 「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり
2026-09-24 pfnet/plamo-3-610m-fin-instruct このリポジトリ — 4GB 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜
2026-09-24 Comfy-Org/Ming-Image このリポジトリ — — 「Ming-Image」UIデザイン特化の画像生成モデル:ComfyUIの配置先
2026-09-24 togethercomputer/Tev1-4B-experimental このリポジトリ — 4GB 「Tev1-4B-experimental」構造化データの意思決定に特化した4Bモデル:必要VRAM 4GB〜
2026-09-24 Edge0/Audio8-ASR-Infinite このリポジトリ — 12GB 「Audio8-ASR-Infinite」音声認識モデル:必要VRAM 12GB〜・配布ファイル一覧
2026-09-23 Viggle/Qwen-Image-2.1-viggle-turbo このリポジトリ — 48GB 「Qwen-Image-2.1-viggle-turbo」4ステップの高速画像生成・編集モデル:必要VRAM 48GB〜
2026-09-21 abenzerps/Qwen-Image-2.1-Uncensored-GGUF このリポジトリ — 16GB 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜
2026-09-20 Qwen/Qwen-Image-2.1-PE-I2I このリポジトリ — — 画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応
2026-09-19 inclusionAI/Realtime-Venus このリポジトリ — 24GB 「Realtime-Venus」全二重音声動画対話モデル:必要VRAM 24GB〜・配布ファイル一覧
2026-09-19 Cactus-Compute/needle3 このリポジトリ — 4GB 「needle3」モバイル向けツール呼び出し特化の自動化モデル:必要VRAM 4GB〜
2026-09-18 tencent/WeVisDoc-4B このリポジトリ — 4GB Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開
2026-09-16 EleutherAI/olmo3-7b-sdf-sft-clean150 このリポジトリ — 24GB EleutherAI、OLMo-3-7Bのハッキング耐性検証用モデル2種公開
2026-09-15 EleutherAI/bergson-wikitext-gpt2-leaderboard このリポジトリ — — EleutherAI、データ帰属の基準モデル「bergson-wikitext-gpt2-leaderboard」公開
2026-09-15 Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4 このリポジトリ — 12GB 「yue2-mothersuperior-realaudio-tokenizer-v4」:必要VRAM 12GB〜
2026-09-13 Comfy-Org/YuE2 このリポジトリ — 12GB 「YuE2」:必要VRAM 12GB〜・ComfyUIの配置先
2026-09-11 Lightricks/LTX-2.5-22b-IC-LoRA-Ingredients このリポジトリ — — Lightricks、動画生成モデル「LTX-2.5」向けのLoRA・IC-LoRA複数種を公開
2026-09-10 m-a-p/YuE2-3B このリポジトリ — 12GB 「YuE2-3B」歌詞とスタイルから楽曲を作る音楽生成モデル:必要VRAM 12GB〜・配布ファイル一覧
2026-09-10 deepseek-ai/DeepSeek-V4.1-Flash このリポジトリ — — 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB
2026-09-10 Efficient-Large-Model/H3-to-LTX-Latent-Adapter このリポジトリ — 4GB 「H3-to-LTX-Latent-Adapter」:必要VRAM 4GB〜・配布ファイル一覧
2026-09-09 nex-agi/Nex-N2.5-Pro このリポジトリ — — 「Nex-N2.5-Pro」長期タスク向けエージェントモデル:必要メモリ約98GB・GGUF版あり
2026-09-09 nex-agi/Nex-N2.5-mini このリポジトリ — 16GB 「Nex-N2.5-mini」長期タスク向けのエージェントモデル:必要VRAM 16GB〜・GGUF版あり
2026-09-08 openbmb/MiniCPM5-2B このリポジトリ — 4GB 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:必要VRAM 4GB〜・GGUF版あり
2026-09-07 phasefield-audio/Irodori-TTS-v4.1-Anime このリポジトリ — 4GB 「Irodori-TTS-v4.1-Anime」アニメ風音声対応の音声合成モデル:必要VRAM 4GB〜
2026-09-07 WarmBloodAban/Minimax-h3_Singularity このリポジトリ — 16GB 「Minimax-h3_Singularity」ComfyUIで動く動画生成モデル:必要VRAM 16GB〜

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。