ONNX形式とは:対応エンジンと入手できるモデルまとめ

ONNX とは

ONNX(Open Neural Network Exchange)は、機械学習のモデルを、作ったフレームワーク(PyTorch など)に依存せずに受け渡すための共通の形式です。拡張子は .onnx で、計算の手順(グラフ)と重みを一緒に持ちます。動かすときは主に Microsoft の ONNX Runtime を使い、LLM 向けには生成の処理をまとめた ONNX Runtime GenAI があります。

何がうれしいのか

  • 動かせる場所が広いです。 ONNX Runtime は、CPU・NVIDIA / AMD の GPU・Windows の DirectML に加え、一部の PC やスマートフォンの NPU(AI 専用の処理装置)にも実行の担当(Execution Provider)を切り替えて対応します。
  • アプリへの組み込みに向いています。 Python が無い環境(C#・C++・Java、ブラウザ)からも同じモデルを動かせます。ブラウザでは Transformers.js が ONNX のモデルを使います。
  • 小さなモデルや、音声・画像の部品でよく使われます。 音声認識・埋め込み・画像の分類のような小さなモデルは、ONNX 版が一緒に配られていることがあります。

手元で動かすときのポイント

  • チャットで大きな LLM を動かす用途では、主流ではありません。 Ollama・LM Studio は ONNX を読み込みません。対話用には GGUF・MLX の方が選択肢が多くあります。
  • ONNX のファイルは、動かす先に合わせて作られていることがあります。 CPU 用・GPU(CUDA / DirectML)用・特定の NPU 用で別のファイルが配られていれば、自分の環境に合うものを選びます。
  • 重みが別ファイルに分かれていることがあります。 2GB を超えるモデルは、.onnx とは別の重みのファイル(.onnx_data など)を一緒に置く必要があります。

出典: ONNX の公式サイト、ONNX Runtime のドキュメント、microsoft/onnxruntime-genai の README、Transformers.js のドキュメント(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、ONNX形式で入手できるモデルの記事を1本公開しています(記事のリポジトリ自体がONNX形式のもの1本、そのモデルのONNX版を確認したもの0本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもONNX版が存在することがあります。モデル形式別まとめの1ページです。

ONNX形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-19 inclusionAI/Realtime-Venus このリポジトリ — 24GB 「Realtime-Venus」全二重音声動画対話モデル:必要VRAM 24GB〜・配布ファイル一覧

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-19(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。