「OpenJev-GGUF」27.4Bの意思決定特化型モデル:必要VRAM 24GB〜

「OpenJev-GGUF」27.4Bの意思決定特化型モデル:必要VRAM 24GB〜

基本情報

項目 内容
リポジトリ ggml-org/OpenJev-GGUF
公開日 2026-10-02
ライセンス cc-by-nc-4.0
配布形式 GGUF
出典の種類 公開元の一次情報(ggml-org公式HFリポジトリの一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

ggml-orgは、意思決定に特化したオープンウェイトモデル「OpenJev」のGGUF量子化版である「ggml-org/OpenJev-GGUF」を公開しました。本モデルは、テキスト、ウェブページ、スクリーンショットを入力として受け取り、選択肢形式の意思決定(decision-model)を行うために設計されています。ユーザーがJSON形式でリクエストした質問に対して、自由なテキストを生成してパースするのではなく、選択肢ごとの確率やスコアを1回のフォワードパスで直接出力する仕組みを備えています。

スペック

元モデルである openjev/openjev のスペック情報は以下の通りです。
– パラメータ数: 27.4B
– アーキテクチャ: Qwen3_5ForConditionalGeneration (qwen3_5)
– コンテキスト長: 最大 16,384 トークン

性能

公開元が公表した元モデル openjev/openjev のベンチマーク結果を紹介します。本モデルはGGUF量子化版であるため、以下の数値は量子化前の元モデルにおける測定値となります。

まず、10,000件のテキスト質問(34の公開ソースを使用)における、他モデルとの比較結果です。

model accuracy
Jev (hosted API) 85.4% (8,540 of 10,000)
OpenJev 84.0% (8,403 of 10,000)
the same base model before tuning, same readout, its own calibration 80.4% (8,036 of 10,000)
Nimble 9B (open) 75.7% (7,574 of 10,000)

この表から、OpenJevはチューニング前のベースモデル(80.4%)や、オープンモデルである Nimble 9B(75.7%)を大きく上回る 84.0% の精度を達成していることが分かります。一方で、ホスト型のAPIである Jev (hosted API) の 85.4% にはわずかに及びませんでしたが、その差は 1.4 ポイントと僅差に迫っています。

次に、分野別の正解率の内訳です。

→ 横にスクロールできます

kind of work questions OpenJev Jev (hosted API) before tuning
intent / routing / topic 1,218 92.8% 92.8% 93.2%
sentiment / stance 1,214 82.1% 81.5% 78.3%
spam / hate 695 80.4% 81.2% 80.1%
legal 1,305 78.9% 78.8% 77.8%
ethics / policy judgement 877 78.1% 75.8% 65.5%
commonsense reasoning 2,260 85.8% 88.3% 80.3%
science / facts / claims 1,558 82.5% 89.0% 81.0%
reading + language 873 89.2% 89.3% 83.3%

この分野別の結果を見ると、OpenJevは「intent / routing / topic」(92.8%)や「reading + language」(89.2%)などのタスクで高い精度を示しています。また、「ethics / policy judgement」(78.1%)や「sentiment / stance」(82.1%)ではホスト型APIである Jev を上回るスコアを記録しています。しかし、「science / facts / claims」(82.5%)や「commonsense reasoning」(85.8%)の分野では、ホスト型APIである Jev(それぞれ 89.0%、88.3%)に対してやや劣る結果となっています。

さらに、エージェントとしての意思決定タスクにおけるチューニング前後の比較結果は以下の通りです。

test steps before tuning OpenJev
desktop: next action from a screenshot 2,000 76.5% 88.0%
web: next action on unseen websites 975 68.5% 87.4%
web: next action on unseen domains 1,000 65.7% 84.5%
answer flips when the options are shuffled 2,000 18.5% 2.3%

この結果から、OpenJevはスクリーンショットからのデスクトップ操作や、未見のウェブサイト・ドメインにおける次のアクションの決定において、チューニング前と比較して 10 ポイント以上の大幅な精度向上を遂げていることが分かります。また、選択肢をシャッフルした際の回答のブレ(answer flips)が 18.5% から 2.3% へと劇的に減少しており、意思決定モデルとしての安定性が極めて高くなっていることが示されています。

多言語対応および長文読解に関する比較は以下の通りです。

test questions before tuning OpenJev
inference in German, French, Hindi, Chinese (XNLI) 240 72.5% 82.5%
intent in German, French, Hindi, Japanese (MASSIVE) 240 80.4% 85.8%
questions about 2,600 to 8,500-token articles (QuALITY) 120 91.7% 91.7%

この表から、ドイツ語、フランス語、ヒンディ語、中国語、日本語を含む多言語タスクにおいて、チューニング前よりも精度が向上していることが分かります。一方で、長文記事に関する質問タスク(QuALITY)においては、チューニング前後で 91.7% とスコアに変化は見られず、同等の性能を維持しています。

最後に、ブラウザタスクをエンドツーエンドで実行した際の完了タスク数です(100種類のMiniWoBタスク、各1回試行)。

model tasks completed
OpenJev 39
Jev (hosted API) 39
the same base model before tuning 38

この結果からは、エンドツーエンドのブラウザタスクにおいて、OpenJevはホスト型の Jev API と同等の 39 タスクを完了しており、チューニング前の 38 タスクからわずかに向上していることが確認できます。

得意なこと・想定用途

本モデルは、テキストや画像(スクリーンショット)を入力として受け取り、事前に定義された選択肢の中から最適な意思決定を行う「意思決定モデル(decision model)」です。一般的なチャットボットのように自由なテキストを生成させてからパースする方式とは異なり、最初の出力位置におけるトークンのスコアから直接確率を算出するため、高速かつ確実な処理が可能です。

元モデルである openjev/openjev の性能や機能に基づくと、以下のような用途やタスクに非常に適しています。

  • ルーティングとトリアージ:
    ユーザーからの問い合わせメッセージの意図(インテント)やトピック、担当チーム、優先度、言語などを判定し、適切な窓口へ自動で振り分けることができます。

  • モデレーションと安全性判定:
    入力されたテキストが有害なコンテンツ、スパム、ヘイトスピーチ、ポリシー違反、または法的な脅威に該当するかどうかを判定できます。

  • 他モデルの評価(LLM as a Judge):
    生成AIモデルの出力が信頼できる根拠に基づいているか(ハルシネーションの有無)、提示された評価基準(ルーブリック)に従っているか、複数の回答のうちどちらが優れているかを客観的に判定できます。

  • 業務プロセスと文書管理:
    請求書の承認、保留、却下の判断や、システムアラートの深刻度判定、契約書における特定の条項タイプの分類など、定型的な判断業務を自動化できます。

  • ブラウザおよびデスクトップエージェント:
    画面のスクリーンショットやHTML(DOM構造)、JSONデータを読み込み、次に操作すべき要素や実行すべきアクション(クリックや入力など)を決定できます。また、タスクが完了したか、あるいは進行がブロックされているかの判定も行えます。

  • スコアリング:
    期待値や信頼度を伴う、順序付けられた段階的な評価を算出できます。

さらに、本モデルはリクエストごとに動的に選択肢(ラベル)を指定できるため、タスクごとの事前トレーニングやラベルの固定化が不要です。1回のリクエストで最大52個の選択肢を1回のフォワードパスで処理できるほか、複数の質問(例:ルーティング、感情分析、緊急度)を同時に1回のリクエストにまとめて処理することも可能です。日本語を含む多言語(英語、ドイツ語、フランス語、ヒンディ語、中国語、日本語)に対応している点も大きな強みです。

類似モデルとの違い

当サイトで以前に紹介した記事意思決定特化型モデル「OpenJev」のテスト用GGUFモデル公開では、同じくggml-orgが公開した「tinyopenjev-for-testing-gguf」を取り上げました。しかし、あちらは推論エンジンやローダーが正常に動作するかを検証するためだけに作られた、極小サイズ(約34Mパラメータ)のテスト専用モデルであり、出力される内容には意味がありませんでした。

これに対して、今回公開された「OpenJev-GGUF」は、元モデルである openjev/openjev の全構造を保持した実用的な量子化モデルです。テスト用モデルとは異なり、実際の意思決定タスクやエージェントの推論用途にそのまま利用することができます。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 27.4B(元モデル openjev/openjev の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4090 / 3090 など 24GB Q4_K_M 17.7GB 21.2GB
RTX 5090 など 32GB Q8_0 26.6GB 32.0GB
A100 / H100 80GB クラス BF16 50.1GB 60.1GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

Ollama・LM Studio・llama.cpp でそのまま動かせます。

GGUF形式で配布されているため、変換を待たずに手元で読み込めます。

ライセンス cc-by-nc-4.0(商用利用不可): 商用利用は禁止されています(NC = 非営利)。社内の業務利用も「商用」に当たり得るため、業務で使う予定があるなら避けるべきライセンスです。

量子化の圧縮率: Q4_K_M は実測 5.56 bit/weight で、元の16bitの重みの約35%のサイズです(配布ファイルの実サイズから当サイトが算出)。

配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

ライセンスの都合で行っていない実測

このモデルのライセンス(cc-by-nc-4.0)は商用利用を認めていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。

同クラスの既報モデル

当サイトが最近取り上げた、パラメータ数 15〜40B のモデルを、比較のために記事ログからコードが並べたものです。VRAM階層は当サイトの概算、ライセンスはモデルカードの記載です。

→ 横にスクロールできます

モデル パラメータ数 最小のVRAM階層 ライセンス 記事
Qwen/Qwen3.8-27B 27.4B 80GB apache-2.0 「clef」構造化出力に特化した27Bの意思決定モデル:必要VRAM 80GB〜(2026-10-02)
Cloudflare/clef 27.4B 80GB apache-2.0 「clef」構造化意思決定モデル:必要VRAM 80GB〜(2026-10-01)
Qwen/Qwen3.8-27B 27.8B 8GB apache-2.0 「Qwen3.8-27B」マルチモーダル視覚言語モデル:当サイトでの回答例・必要VRAM 8GB〜・GGUF版あり(2026-09-26)
bartowski/vectionlabs_Salience-27B-R6-GGUF 27.8B 12GB apache-2.0 「vectionlabs_Salience-27B-R6-GGUF」:当サイトでの回答例・必要VRAM 12GB〜(2026-09-15)
agentionai/Signal-3.8-27B-GGUF 27.8B 16GB apache-2.0 「Signal-3.8-27B-GGUF」VLMモデル:当サイトでの回答例・必要VRAM 16GB〜(2026-09-12)

入手方法

本モデルはGGUF形式で配布されており、推論エンジンである llama.cpp などを用いて動かすことができます。

起動する際は、llama.cpp に含まれる llama serve コマンドを使用し、Hugging Faceのリポジトリから直接モデルを読み込んでサーバーを立ち上げることが可能です。以下のコマンドを実行することで、ローカル環境でAPIサーバーが起動します。

llama serve -hf ggml-org/OpenJev-GGUF

起動後は、/v1/systemone という専用のAPIエンドポイントを介して意思決定のリクエストを送信することができます。

なお、本モデルのウェイトは「CC BY-NC 4.0」ライセンスの下で公開されています。非商用目的の研究や利用には無料で利用できますが、商業目的で利用する場合は別途商用ライセンスの取得が必要となりますのでご注意ください。

関連記事

次に読むなら

出典