Appleのオープンモデルまとめ:公開モデル一覧・ライセンス・記事
Apple について
Apple は、Hugging Face の apple の組織(Hugging Face の認証済み組織)で、自社の機械学習研究の成果物として143件のモデルを公開しています。製品に組み込む Apple Intelligence のモデルそのものではなく、論文とセットで公開する研究用のモデルが中心です。
特徴は、少ない計算量で動かすための工夫を主題にした研究が多いことです。画像を少ないトークンにまとめる視覚エンコーダ、長い文書を画像に縮めて読む方法、拡散モデルでのコード生成、自分の出力だけで追加学習する方法など、モデルの大きさを競うより「同じ大きさでどう効率よく動かすか」を扱っています。土台には Qwen・Mistral など他社のオープンモデルを使うことが多いです。
何を公開しているのか
- LensVLM-9B(2026年9月): Qwen3.5-9B をもとに、長い文書を画像に縮めて流し読みし、必要なページだけを元の形に戻して読む視覚言語モデルです(当サイトの記事)。
- SimpleSD(2026年3月): 報酬・検証器・教師モデル・強化学習を使わず、モデル自身が生成した出力で追加学習してコード生成を改善する方法(Simple Self-Distillation)の研究用チェックポイントです。4B と 30B(Qwen3-30B-A3B ベース)があります。
- CADD-Base-7B(2026年4月)・DiffuCoder-7B(2025年7月): 文章を左から順に書くのではなく、全体を少しずつ埋めていく拡散型の言語モデルで、コード生成を扱います。
- CLaRa-7B(2025年12月): 検索(RAG)で取ってきた文書を圧縮した表現に変え、検索と生成をつなぐ研究のモデルで、Mistral-7B-Instruct をもとにしています。
- FastVLM(2025年8月): 高解像度の画像を少ないトークンにまとめる視覚エンコーダ FastViTHD を使った視覚言語モデルで、0.5B・1.5B・7B があります。モデルカードによれば、最小のモデルは LLaVA-OneVision-0.5B より最初のトークンが出るまでが 85 倍速いとしています。
- ほかに、画像とテキストの埋め込みモデル MobileCLIP / MobileCLIP2、1枚の写真から 3D の場面を作る Sharp、画像生成の研究 STARFlow などがあります。
ライセンス
確認した LensVLM・SimpleSD・CADD・CLaRa・DiffuCoder・FastVLM・STARFlow・Sharp は、いずれも Apple Machine Learning Research Model License です。使えるのは非商用の科学研究と学術的な開発に限られ、商用の製品やサービスへの利用と製品開発は明示的に除外されています。追加学習した派生モデルにも同じ制限がかかります。手元で試すことはできても、仕事で使うツールに組み込むことはできない、と考えてください。使う前に各モデルのライセンス原文を確認してください。上の要約は法的な助言ではありません。
手元で動かすときのポイント
- 公開しているモデルの多くは 10B 以下で、家庭用の GPU や Mac で試せる大きさです。
- FastVLM は Apple 自身が MLX 向けに変換した版(int4・int8・fp16)を出しており、モデルカードは公式リポジトリの手順で iOS・macOS のアプリから動かす方法を案内しています。
- 研究用のモデルは、付属のコードと一緒に使う前提のものが多いです。 LensVLM のページの取り寄せ、拡散型の言語モデルの生成手順などは、一般的なチャットツールに重みを読み込ませただけでは働きません。各モデルカードが案内する GitHub のコードを確認してください。
- 公式の GGUF 版はありません(2026-09-28 時点)。
出典: apple の組織カード、apple/LensVLM-9B・apple/SimpleSD-30B-instruct・apple/CADD-Base-7B・apple/CLaRa-7B-Instruct・apple/FastVLM-7B のモデルカードとライセンス、Hugging Face 上の apple の組織のモデル一覧(いずれも 2026-09-28 時点)。
当サイトの記録とデータ
当サイトはApple自身のモデルの記事を1本、それを元に第三者が作ったファインチューン・量子化版の記事を0本、公式ブログの記事を0本公開しています。下の Hugging Face のモデル一覧は、コードが毎日取得しています。公開元別のまとめの1ページで、シリーズ名はモデル系統別まとめの各ページへリンクしています。
基本情報
| 項目 | 内容 |
|---|---|
| Hugging Face の組織 | apple |
| Hugging Face の公開モデル数 | 143件 |
| 公式モデルの記事 | 1本 |
| 派生モデルの記事 | 0本 |
Hugging Face で公開しているモデル
公開元が Hugging Face で公開しているモデルは全部で 143件です。そのうち、当サイトが扱う生成モデル(テキスト・画像・動画・音声など)の新しいものを組織ごとに最大15件並べています。分類・特徴抽出などのモデル、研究用の部品、モデルカードの無いリポジトリは除き、公開元自身の量子化版・補助の別版は元のモデルの行にまとめています。重みを整数型に詰めて保存したリポジトリは、Hugging Face の集計が実際のパラメータ数と違うため、パラメータ数を空欄にしています。
→ 横にスクロールできます
| 公開日 | モデル | 用途 | パラメータ数 | ライセンス | 同じモデルの公式の別版 |
|---|---|---|---|---|---|
| 2026-09-22 | apple/LensVLM-9B | VLM・マルチモーダル | 9.4B | apple-amlr |
— |
| 2026-04-24 | apple/CADD-Base-7B | テキスト生成 | 7.6B | apple-amlr |
— |
| 2026-03-18 | apple/SimpleSD-30B-instruct | テキスト生成 | 30.5B | apple-amlr |
— |
| 2026-03-18 | apple/SimpleSD-4B-thinking | テキスト生成 | 4.0B | apple-amlr |
— |
| 2026-03-18 | apple/SimpleSD-4B-instruct | テキスト生成 | 4.0B | apple-amlr |
— |
| 2025-12-12 | apple/Sharp | 3D生成 | — | apple-amlr |
— |
| 2025-12-02 | apple/CLaRa-7B-Instruct | — | — | apple-amlr |
— |
| 2025-08-26 | apple/FastVLM-7B | テキスト生成 | 7.8B | apple-amlr |
int4 |
| 2025-08-26 | apple/FastVLM-1.5B | テキスト生成 | 1.9B | apple-amlr |
int8 |
| 2025-08-26 | apple/FastVLM-0.5B | テキスト生成 | 759M | apple-amlr |
fp16 |
| 2025-07-02 | apple/DiffuCoder-7B-cpGRPO | — | 7.6B | apple-amlr |
— |
| 2025-07-02 | apple/DiffuCoder-7B-Instruct | — | 7.6B | apple-amlr |
— |
| 2025-07-02 | apple/DiffuCoder-7B-Base | — | 7.6B | apple-amlr |
— |
| 2025-03-13 | apple/sage-ft-mixtral-8x7b | テキスト生成 | 46.7B | apache-2.0 |
— |
| 2024-07-16 | apple/DCLM-7B-8k | — | 6.9B | apple-ascl |
— |
Hugging Face の API からコードが取得した値です。最終更新 2026-09-28(JST)。
公式モデルのライセンス(記事に記録した値)
| ライセンス | 商用利用 | モデル |
|---|---|---|
apple-amlr |
当サイトの対応表に無い | apple/LensVLM-9B |
同じ公開元でも、モデルごとにライセンスが違うことがあります。法的な助言ではありません。使う前に各モデルのライセンス原文を確認してください。
シリーズ別
→ 横にスクロールできます
| シリーズ | 公式モデルの記事 | 派生モデルの記事 | 最小のVRAM階層 | 最新の記事 |
|---|---|---|---|---|
| Qwen3.5 | 1 | 0 | — | 2026-09-28 |
公式モデルの記事
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-28 | apple/LensVLM-9B | 新モデル | 「LensVLM-9B」長文を画像として縮小して処理する視覚言語モデル:必要VRAM 4GB〜・GGUF版あり |
最終更新 2026-09-28(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログとHugging Face の API からコードが組み立てています。