Unsloth v0.1.901-beta公開、4-bit学習のメモリ削減とデスクトップUI強化

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | unslothai/unsloth |
| 版 | v0.1.901-beta |
| 公開日 | 2026-10-01 |
| ライセンス | Apache-2.0 |
| 出典の種類 | 公開元の一次情報(公式GitHubリポジトリのリリースノートが一次情報) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
ローカル環境でLLMや拡散モデルの実行およびファインチューニングを行うためのPython製ツール「unslothai/unsloth」(ライセンス:Apache-2.0)の最新バージョン「v0.1.901-beta」がリリースされました。本ツールは、GGUFやMLX、Qwen3.8、DeepSeek-V4、MiniMax-H3、Gemma 4、FLUXなど、幅広いモデルやフォーマットをサポートしているのが特徴です。
今回のアップデートにおける最も大きな変更点は、デスクトップ版へのコマンドパレットの導入による操作性の向上と、LoRAトレーニング時における4-bitチェックポイント(NVFP4、INT4、MXFP4)のメモリ使用量の大幅な削減です。これにより、限られたGPUメモリ環境でも、より大規模なモデルのファインチューニングが効率的に行えるようになります。
主な変更点
デスクトップUIと操作性の向上
デスクトップ版において、キーボードショートカット「Cmd/Ctrl+P」で起動できるコマンドパレットが追加され、アプリ内のナビゲーションが大幅に高速化されました。また、GGUFモデルの実行設定をリンクとして共有したり、モデルをロードすることなく設定を保存したりすることが可能になっています。
さらに、チャット機能も強化されており、途中で終了した回答を延長する「Continue response」機能や、HTMLキャンバスのエラーをメッセージボックスに挿入してモデルに修正を依頼できる「Fix with the model」機能が追加されました。GPUメモリにモデルが部分的にしか収まらない場合に警告を表示する機能や、画像ギャラリーでサムネイルを優先的に読み込む機能も実装され、ユーザー体験が向上しています。
LoRAトレーニングにおけるメモリ使用量の大幅な削減
事前量子化された4-bitチェックポイント(NVFP4、INT4、MXFP4)を、元の公開されたウェイトのまま直接トレーニングできるようになりました。トレーニング時にこれらをパックされた状態で読み込むため、ロードされたモデルは4-bitチェックポイントとほぼ同等のメモリしか消費しません。
具体的には、以下のような改善が報告されています。
– Qwen3.8-27B-NVFP4: 1枚のRTX PRO 6000におけるピークメモリが72.9 GBから40.2 GBへと45%削減され、ステップ時間も11%短縮されました。
– Qwen3-8B w4a16: B200において、従来の18.8 GBから8.5 GBへとピークメモリが削減されました。
– Kimi-K2.7-Code: 16-bitコピーでは約2 TBのメモリが必要なところ、INT4のエキスパートをパックしたまま6台のB200でトレーニング可能になりました。
– gpt-oss-120b: MXFP4エキスパートを保持したまま、1台のB200でトレーニングが可能になりました。
なお、推論のみで gpt-oss を使用する際、プレフィル(Prefill)速度を向上させるためにネイティブロードに戻したい場合は、環境変数 UNSLOTH_MXFP4_KEEP_PACKED=0 を設定してください。
Laya意思決定モデルの高速化とDecision APIの拡張
Laya意思決定モデル(Laya decision models)による短いリクエストの処理速度が最大4.1倍高速化されました。また、Layaのロード時間が17秒から約9秒に短縮され、ホストRAMのピーク使用量も約半分に削減されています。
さらに、TypeSafeなどのホスト型意思決定プロバイダーとの接続に対応し、「Connections」から追加して「Settings > API」でモデルを選択できるようになりました。Decision APIが有効な場合、チャットのMCPメニューで「Unsloth Decisions」を有効にすることで、決定ツール(decide tool)が使用可能になります。
画像およびビデオ処理の最適化
画像モデルをオフロードする際、INT8またはFP8の精度を維持するようになりました。これにより、メモリが10 GiBに制限されたB200において、Z-Imageの処理時間が38.4秒から2.3秒に短縮されました。また、Radeon 8060Sにおいて、Qwen-Image-2.1による1536×1536画像のレンダリング速度が最大3.6倍高速化されています。
トレーニング機能と対応モデルの拡充
FastModel を用いて、T5、T5Gemma、BART、Marianなどのテキストエンコーダー・デコーダーモデルのファインチューニングが可能になりました。また、新しい unsloth eval コマンドが追加され、チェックポイントやLoRAアダプターに対して lm-evaluation-harness による評価タスクを実行できるようになりました。さらに、複数GPUに分割されたモデルにおいて、Gemma 4 31Bのトレーニングおよびバッチ生成が動作するようになっています。
対応モデル・ハードウェア
今回のアップデートでは、多数の新しいモデルアーキテクチャへの対応と、特定のハードウェア環境における最適化が実施されました。
新規対応モデルの詳細
前半で触れたテキストエンコーダー・デコーダーモデルや Gemma 4 以外にも、以下のモデルが新たにサポートされています。
– Idefics3 (Granite Docling VLM): PR #4241 により、Idefics3 アーキテクチャのサポートが追加されました。
– Qwen2.5 Coder: モデルレジストリおよびチャットテンプレートに Qwen2.5 Coder が正式に追加されました(PR #4221)。
– Kimi-K3: MXFP4 エキスパートをパックしたまま保持し、実行時にデクオンタイズ(逆量子化)を行う形式でのトレーニングに対応しました(PR #11750)。
– MiniCPM3: GRPO グラジエントの DDP ランク間での平均化や、MiniCPM3 独自のプレヘッドスケーリングの維持に対応しています(PR #12193)。
– Qwen3.8-Flash-Next: n-gram テーブルなどの配置指定のないパラメータを CPU に保持することで、このモデルのロードが可能になりました(PR #12141)。
– カスタムビジョンプロジェクター: Unsloth Studio および Desktop において、カスタムのビジョンプロジェクターを搭載したモデルがサポートされました(PR #11352)。
ハードウェア別の最適化と更新
各プラットフォームの利用者にとって重要な変更点は以下の通りです。
- AMD (Windows): RX 5000 から RX 9000 シリーズのグラフィックスカードにおいて、AMD のマルチアーキテクチャインデックスから PyTorch を取得するように改善されました。これにより、RX 5700 XT (RDNA 1) などの環境でも適切なインストールが行われます(PR #11755、PR #11846)。また、NVIDIA と AMD が混在するホスト環境では、llama.cpp がインストール済みの PyTorch に合わせて自動的にバックエンドを選択します。
- Apple Silicon (Mac): MLX のライブラリが 0.32.3 に、mlx-vlm が 0.7.4 にそれぞれ更新されました。Mac 上でファインチューニングした LoRA アダプターを PEFT または GGUF 形式でエクスポートし、他の GPU マシンで利用できる機能が追加されています(PR #7539)。また、量子化された KV キャッシュを用いたビジョンモデルのロードにおいて、バッチ処理による応答が可能になりました。
- NVIDIA GPU: B200 において、画像モデルのオフロード時に INT8 または FP8 の精度を維持する最適化が行われました。これにより、10 GiB にメモリが制限された環境での Z-Image の処理が大幅に高速化されています。また、Windows および Linux 環境では、Windows 11 スタイルのボタンが UI に導入されました。
アップデート方法
利用環境に応じて、以下の手順で最新版への更新を行ってください。
Unsloth Desktop (GUI)
デスクトップアプリ版を利用している場合は、公式のリリースページから各プラットフォーム用の最新インストーラーをダウンロードして実行してください。
– Windows: Unsloth-Desktop-Windows.exe
– macOS: Unsloth-Desktop-MacOS.dmg
– Linux (Ubuntu/deb): Unsloth-Desktop-Ubuntu.deb
– Linux (AppImage): Unsloth-Desktop-Linux.AppImage
Unsloth Studio (CLI/開発版)
ソースコードからインストールしている場合は、リポジトリをプルした後にインストールスクリプトを再実行します。
macOS, Linux, WSL の場合:
cd unsloth && git pull
./install.sh --local
unsloth studio -p 8888
Windows (PowerShell) の場合:
cd unsloth; git pull
.\install.ps1 --local
unsloth studio -p 8888
特定のバックエンド(Vulkan など)を強制したい場合は、インストール前に環境変数を設定してください。
export UNSLOTH_LLAMA_CPP_BACKEND=vulkan
./install.sh --local
関連記事
- unsloth Desktop v0.1.900-beta公開。Laya搭載と生成高速化
- UnslothがQwen-Image-2.1対応とAgent Skills機能を追加
- Unsloth v0.1.811-beta公開、Docker・AMD・マルチユーザー対応
- 「unsloth」v0.1.810-beta公開:マルチユーザー対応とDocker刷新
次に読むなら
- このツールの更新を追う → Unsloth の概要とリリース履歴(記録済み73版)
- 同じ分類(量子化・モデル形式・ファインチューニング)の他のツール → ggml / ExLlamaV3
出典
- https://github.com/unslothai/unsloth/releases/tag/v0.1.901-beta
- https://github.com/unslothai/unsloth/pull/4241
- https://github.com/unslothai/unsloth/pull/4221
- https://github.com/unslothai/unsloth/pull/11750
- https://github.com/unslothai/unsloth/pull/12193
- https://github.com/unslothai/unsloth/pull/12141
- https://github.com/unslothai/unsloth/pull/11352
- https://github.com/unslothai/unsloth/pull/11755
- https://github.com/unslothai/unsloth/pull/11846
- https://github.com/unslothai/unsloth/pull/7539
