意思決定特化型モデル「OpenJev」のテスト用GGUFモデル公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | ggml-org/tinyopenjev-for-testing-gguf |
| 公開日 | 2026-10-02 |
| ライセンス | cc-by-nc-4.0 |
| 配布形式 | GGUF |
| 出典の種類 | 公開元の一次情報(ggml-org公式HFリポジトリで裏付けあり) |
情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。
概要
ggml-orgは、意思決定に特化したオープンウェイトモデル「OpenJev」の動作テストを目的とした、極小サイズのGGUFモデル「tinyopenjev-for-testing-gguf」を公開しました。このモデルは、推論エンジンやローダーが正常に動作するかを確認するためのもので、元モデルである openjev/openjev の構造をごく一部だけ切り出したサブセットとなっています。
本モデルはテスト専用であり、出力される内容に意味はありません。開発者がローダーやランタイムの挙動を検証するために設計されており、実用的な推論用途には適さないものです。
主張と根拠
公開された tinyopenjev-for-testing-gguf は、Q8_0量子化が施されたGGUF形式(テキストモデルおよびmmproj)のモデルです。このモデルは、元モデルの構造を大幅に削減した構成となっており、発表者によって以下の詳細が示されています。
- テキストレイヤー:全64層のうち、最初の4層のみを保持しています
- ビジョンブロック:全27ブロックのうち、最初の2ブロックのみを保持しています
- 隠れ層サイズ(hidden size):5120から64へと縮小されています
- その他:アテンションヘッド数の削減や、FFN(Feed-Forward Network)の小型化が行われています
この構成により、パラメータ数は約34Mに抑えられていますが、その大部分はトークン埋め込み(token embedding)と出力行列(output matrices)で占められています。発表者は、このモデルの出力には意味がないため、ローダーやランタイムのテスト以外の目的で使用しないよう明示しています。
また、元モデルである openjev/openjev の性能についても詳細なデータが公開されています。OpenJevは、テキストやWebページ、スクリーンショットから「型定義された意思決定(Typed decisions)」を高速に行うためのモデルです。1回のフォワードパスで最大52個の選択肢を評価でき、自由形式のテキスト生成を待たずに直接確率スコアを出力する仕組みを備えています。
発表者が実施した、10,000件のテキスト質問(34の公開ソースを使用)に基づく精度検証の結果は以下の通りです。
| model | accuracy |
|---|---|
| Jev (hosted API) | 85.4% (8,540 of 10,000) |
| OpenJev | 84.0% (8,403 of 10,000) |
| the same base model before tuning, same readout, its own calibration | 80.4% (8,036 of 10,000) |
| Nimble 9B (open) | 75.7% (7,574 of 10,000) |
この測定において、OpenJevはホスト型のJev APIに対して1.4ポイント差まで迫る精度を示し、チューニング前のベースモデルと比較して3.7ポイント、Nimble 9Bと比較して8.3ポイント高い精度を記録したと報告されています。
分野別の意思決定精度については、以下の数値が示されています。
→ 横にスクロールできます
| kind of work | questions | OpenJev | Jev (hosted API) | before tuning |
|---|---|---|---|---|
| intent / routing / topic | 1,218 | 92.8% | 92.8% | 93.2% |
| sentiment / stance | 1,214 | 82.1% | 81.5% | 78.3% |
| spam / hate | 695 | 80.4% | 81.2% | 80.1% |
| legal | 1,305 | 78.9% | 78.8% | 77.8% |
| ethics / policy judgement | 877 | 78.1% | 75.8% | 65.5% |
| commonsense reasoning | 2,260 | 85.8% | 88.3% | 80.3% |
| science / facts / claims | 1,558 | 82.5% | 89.0% | 81.0% |
| reading + language | 873 | 89.2% | 89.3% | 83.3% |
エージェントとしての意思決定性能(スクリーンショットからの次アクション決定など)については、以下の改善が示されています。
| test | steps | before tuning | OpenJev |
|---|---|---|---|
| desktop: next action from a screenshot | 2,000 | 76.5% | 88.0% |
| web: next action on unseen websites | 975 | 68.5% | 87.4% |
| web: next action on unseen domains | 1,000 | 65.7% | 84.5% |
| answer flips when the options are shuffled | 2,000 | 18.5% | 2.3% |
特に、選択肢の順序を入れ替えた際の回答の安定性(answer flips)が、チューニング前の18.5%から2.3%へと大幅に改善されている点が特徴的です。
多言語対応および長文読解に関するベンチマーク結果は以下の通りです。
| test | questions | before tuning | OpenJev |
|---|---|---|---|
| inference in German, French, Hindi, Chinese (XNLI) | 240 | 72.5% | 82.5% |
| intent in German, French, Hindi, Japanese (MASSIVE) | 240 | 80.4% | 85.8% |
| questions about 2,600 to 8,500-token articles (QuALITY) | 120 | 91.7% | 91.7% |
日本語を含むMASSIVEベンチマークにおいても、85.8%の精度を達成しています。
推論速度に関しては、H100 GPUを1基使用し、FP8精度で測定した際の中央値が報告されています。
– 短いテキスト決定:約80 ms
– デスクトップ操作(スクリーンショット含む):176 ms
– Web操作(約1,460プロンプトトークン、23の選択肢):約210 ms
– 1,200トークンの異なるページに対する並列リクエスト(同時実行数8):1秒あたり7リクエスト
これらの高速な意思決定は、最初の出力ポジションのスコアから直接回答を読み取ることで、自由形式のテキスト生成や長い生成待ち時間を排除した仕組みによって実現されています。
前提条件
本資料で示されたテスト用モデルおよび元モデルを利用・検証するための条件は以下の通りです。
対象モデルとアーキテクチャ
- テスト用モデル:
tinyopenjev-for-testing-gguf(元モデルの構造を大幅に削減したスライス) - 元モデル:
openjev/openjev(27.4Bパラメータ) - アーキテクチャ:
Qwen3_5ForConditionalGeneration(Qwen/Qwen3.8-27Bをベースに構築) - 量子化形式: Q8_0 (GGUF版)、FP8 (元モデルの速度測定時)
ソフトウェア環境
- 推論エンジン:
vllm==0.29.0 - クライアントライブラリ:
openai==3.16.2,httpx==0.28.1 - 補助ツール:
openjev/helper/shim.py(意思決定API用シム)
ハードウェア要件
- テスト用モデル (
tinyopenjev-for-testing-gguf):- パラメータ数: 約34M – 必要VRAM量: 約0.1GB (Q8_0量子化時) – 動作環境例: 4GBのVRAMを搭載したノートPCの内蔵GPUやスマートフォンなどでも動作可能とされています。
- 元モデル (
openjev/openjev):- パラメータ数: 27.4B – 推論速度測定環境: NVIDIA H100 GPU (FP8精度)
設定および制限事項
- 文脈長: 最大16,384トークン
- 画像入力: 1リクエストにつき1枚まで
- 選択肢数: 1回のパスで最大52個まで (それ以上の場合は複数パスで処理)
- ライセンス: CC BY-NC 4.0 (非商用利用に限定、商用利用は別途ライセンスが必要)
手元で再現できる範囲
読者は、公開されているリポジトリを利用して、自身の環境で以下の検証を行うことができます。
テスト用モデルによるローダー検証
ggml-org/tinyopenjev-for-testing-gguf を使用することで、GGUF形式のローダーやランタイムが正常に動作するかを最小限のリソースで確認できます。このモデルにはテキストモデルだけでなく mmproj も含まれているため、マルチモーダルな入力パイプラインのテストも可能です。ただし、モデルの構造(レイヤー数や隠れ層サイズ)が大幅に削減されているため、推論結果の妥当性を検証することはできません。
元モデルのサービングとAPI利用
元モデル openjev/openjev を使用して、実際に意思決定タスクを実行する環境を構築できます。再現手順は以下の通りです。
-
モデルの準備:
hf download openjev/openjev --local-dir openjevコマンドを使用して、モデルファイルをローカルに取得します。 -
推論サーバーの起動:
vllmを使用して、以下のコマンドでサーバーを立ち上げます。bash vllm serve./openjev --host 127.0.0.1 --served-model-name qwen --port 8000 \ --enable-prefix-caching --max-model-len 16384 --gpu-memory-utilization 0.90 \ --limit-mm-per-prompt '{"image":1}' --trust-remote-code --max-num-seqs 256 \ --max-logprobs 64 --gdn-prefill-backend triton --quantization fp8 -
意思決定APIの構築:
付属のshim.pyを使用して、意思決定に特化したAPIエンドポイントを構築します。bash VLLM=http://localhost:8000/v1 TOKENIZER=./openjev \ READOUT_T=0.85 READOUT_NOUL_T=1.829074 READOUT_NOUL_BIAS=0 \ READOUT_TARGETED=1 READOUT_INSTR_STYLE=pyrepr SHIM_STAGGER=1 \ python openjev/helper/shim.py --host 127.0.0.1 --port 3000 -
リクエストの実行:
curlコマンド等を用いて、特定のテキストや画像に対する意思決定リクエストを送信できます。リクエストには、質問内容、選択肢、スコアリングの基準などをJSON形式で含めることができます。
資料が触れていないこと
本資料には、以下の情報が含まれていません。
- テスト用モデル
tinyopenjev-for-testing-ggufが出力する「意味のない内容」の具体的なテキスト例や、どのような挙動を示すのかについての詳細な説明はありません。 - GGUF形式に量子化されたモデルの精度について、10,000問のフルセットを用いたベンチマーク結果は示されておらず、1,789問のサブセットによる測定も「現時点でのデータ」としての扱いに留まっています。
- H100以外の一般的なコンシューマー向けGPU(例:NVIDIA GeForce RTXシリーズ)における、具体的な推論レイテンシやスループットの測定データは記載されていません。
- 商用ライセンスを取得する際の具体的なコストや、サポート体制の詳細については触れられていません。
- チューニング前のベースモデルとOpenJevの間で行われた、具体的な学習データセットの内容や学習時間については明記されていません。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 27.4B(元モデル openjev/openjev の値)
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 4GB(ノートPCの内蔵GPU・スマートフォンなど) | Q8_0 | 0.0GB | 0.1GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
関連記事
- 「OpenJev-GGUF」27.4Bの意思決定特化型モデル:必要VRAM 24GB〜
- 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB
- 「MiMo-V2.6-Distill-Qwen-9B-GGUF」:当サイトでの回答例・必要VRAM 12GB〜
- ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化
次に読むなら
- GPUのVRAMから探す(このモデルは4GBの階層から動きます) → 8GBのGPUで動くほかのモデル
- 記事に出てくるエンジンを調べる → ggml / vLLM
- 表に出てくる Q8_0 の意味を知る → 量子化・モデル形式の用語集

