意思決定特化型モデル「OpenJev」のテスト用GGUFモデル公開

意思決定特化型モデル「OpenJev」のテスト用GGUFモデル公開

基本情報

項目 内容
リポジトリ ggml-org/tinyopenjev-for-testing-gguf
公開日 2026-10-02
ライセンス cc-by-nc-4.0
配布形式 GGUF
出典の種類 公開元の一次情報(ggml-org公式HFリポジトリで裏付けあり)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

ggml-orgは、意思決定に特化したオープンウェイトモデル「OpenJev」の動作テストを目的とした、極小サイズのGGUFモデル「tinyopenjev-for-testing-gguf」を公開しました。このモデルは、推論エンジンやローダーが正常に動作するかを確認するためのもので、元モデルである openjev/openjev の構造をごく一部だけ切り出したサブセットとなっています。

本モデルはテスト専用であり、出力される内容に意味はありません。開発者がローダーやランタイムの挙動を検証するために設計されており、実用的な推論用途には適さないものです。

主張と根拠

公開された tinyopenjev-for-testing-gguf は、Q8_0量子化が施されたGGUF形式(テキストモデルおよびmmproj)のモデルです。このモデルは、元モデルの構造を大幅に削減した構成となっており、発表者によって以下の詳細が示されています。

  • テキストレイヤー:全64層のうち、最初の4層のみを保持しています
  • ビジョンブロック:全27ブロックのうち、最初の2ブロックのみを保持しています
  • 隠れ層サイズ(hidden size):5120から64へと縮小されています
  • その他:アテンションヘッド数の削減や、FFN(Feed-Forward Network)の小型化が行われています

この構成により、パラメータ数は約34Mに抑えられていますが、その大部分はトークン埋め込み(token embedding)と出力行列(output matrices)で占められています。発表者は、このモデルの出力には意味がないため、ローダーやランタイムのテスト以外の目的で使用しないよう明示しています。

また、元モデルである openjev/openjev の性能についても詳細なデータが公開されています。OpenJevは、テキストやWebページ、スクリーンショットから「型定義された意思決定(Typed decisions)」を高速に行うためのモデルです。1回のフォワードパスで最大52個の選択肢を評価でき、自由形式のテキスト生成を待たずに直接確率スコアを出力する仕組みを備えています。

発表者が実施した、10,000件のテキスト質問(34の公開ソースを使用)に基づく精度検証の結果は以下の通りです。

model accuracy
Jev (hosted API) 85.4% (8,540 of 10,000)
OpenJev 84.0% (8,403 of 10,000)
the same base model before tuning, same readout, its own calibration 80.4% (8,036 of 10,000)
Nimble 9B (open) 75.7% (7,574 of 10,000)

この測定において、OpenJevはホスト型のJev APIに対して1.4ポイント差まで迫る精度を示し、チューニング前のベースモデルと比較して3.7ポイント、Nimble 9Bと比較して8.3ポイント高い精度を記録したと報告されています。

分野別の意思決定精度については、以下の数値が示されています。

→ 横にスクロールできます

kind of work questions OpenJev Jev (hosted API) before tuning
intent / routing / topic 1,218 92.8% 92.8% 93.2%
sentiment / stance 1,214 82.1% 81.5% 78.3%
spam / hate 695 80.4% 81.2% 80.1%
legal 1,305 78.9% 78.8% 77.8%
ethics / policy judgement 877 78.1% 75.8% 65.5%
commonsense reasoning 2,260 85.8% 88.3% 80.3%
science / facts / claims 1,558 82.5% 89.0% 81.0%
reading + language 873 89.2% 89.3% 83.3%

エージェントとしての意思決定性能(スクリーンショットからの次アクション決定など)については、以下の改善が示されています。

test steps before tuning OpenJev
desktop: next action from a screenshot 2,000 76.5% 88.0%
web: next action on unseen websites 975 68.5% 87.4%
web: next action on unseen domains 1,000 65.7% 84.5%
answer flips when the options are shuffled 2,000 18.5% 2.3%

特に、選択肢の順序を入れ替えた際の回答の安定性(answer flips)が、チューニング前の18.5%から2.3%へと大幅に改善されている点が特徴的です。

多言語対応および長文読解に関するベンチマーク結果は以下の通りです。

test questions before tuning OpenJev
inference in German, French, Hindi, Chinese (XNLI) 240 72.5% 82.5%
intent in German, French, Hindi, Japanese (MASSIVE) 240 80.4% 85.8%
questions about 2,600 to 8,500-token articles (QuALITY) 120 91.7% 91.7%

日本語を含むMASSIVEベンチマークにおいても、85.8%の精度を達成しています。

推論速度に関しては、H100 GPUを1基使用し、FP8精度で測定した際の中央値が報告されています。
– 短いテキスト決定:約80 ms
– デスクトップ操作(スクリーンショット含む):176 ms
– Web操作(約1,460プロンプトトークン、23の選択肢):約210 ms
– 1,200トークンの異なるページに対する並列リクエスト(同時実行数8):1秒あたり7リクエスト

これらの高速な意思決定は、最初の出力ポジションのスコアから直接回答を読み取ることで、自由形式のテキスト生成や長い生成待ち時間を排除した仕組みによって実現されています。

前提条件

本資料で示されたテスト用モデルおよび元モデルを利用・検証するための条件は以下の通りです。

対象モデルとアーキテクチャ

  • テスト用モデル: tinyopenjev-for-testing-gguf (元モデルの構造を大幅に削減したスライス)
  • 元モデル: openjev/openjev (27.4Bパラメータ)
  • アーキテクチャ: Qwen3_5ForConditionalGeneration (Qwen/Qwen3.8-27B をベースに構築)
  • 量子化形式: Q8_0 (GGUF版)、FP8 (元モデルの速度測定時)

ソフトウェア環境

  • 推論エンジン: vllm==0.29.0
  • クライアントライブラリ: openai==3.16.2, httpx==0.28.1
  • 補助ツール: openjev/helper/shim.py (意思決定API用シム)

ハードウェア要件

  • テスト用モデル (tinyopenjev-for-testing-gguf):
    • パラメータ数: 約34M – 必要VRAM量: 約0.1GB (Q8_0量子化時) – 動作環境例: 4GBのVRAMを搭載したノートPCの内蔵GPUやスマートフォンなどでも動作可能とされています。
  • 元モデル (openjev/openjev):
    • パラメータ数: 27.4B – 推論速度測定環境: NVIDIA H100 GPU (FP8精度)

設定および制限事項

  • 文脈長: 最大16,384トークン
  • 画像入力: 1リクエストにつき1枚まで
  • 選択肢数: 1回のパスで最大52個まで (それ以上の場合は複数パスで処理)
  • ライセンス: CC BY-NC 4.0 (非商用利用に限定、商用利用は別途ライセンスが必要)

手元で再現できる範囲

読者は、公開されているリポジトリを利用して、自身の環境で以下の検証を行うことができます。

テスト用モデルによるローダー検証

ggml-org/tinyopenjev-for-testing-gguf を使用することで、GGUF形式のローダーやランタイムが正常に動作するかを最小限のリソースで確認できます。このモデルにはテキストモデルだけでなく mmproj も含まれているため、マルチモーダルな入力パイプラインのテストも可能です。ただし、モデルの構造(レイヤー数や隠れ層サイズ)が大幅に削減されているため、推論結果の妥当性を検証することはできません。

元モデルのサービングとAPI利用

元モデル openjev/openjev を使用して、実際に意思決定タスクを実行する環境を構築できます。再現手順は以下の通りです。

  1. モデルの準備:
    hf download openjev/openjev --local-dir openjev コマンドを使用して、モデルファイルをローカルに取得します。

  2. 推論サーバーの起動:
    vllm を使用して、以下のコマンドでサーバーを立ち上げます。 bash vllm serve./openjev --host 127.0.0.1 --served-model-name qwen --port 8000 \ --enable-prefix-caching --max-model-len 16384 --gpu-memory-utilization 0.90 \ --limit-mm-per-prompt '{"image":1}' --trust-remote-code --max-num-seqs 256 \ --max-logprobs 64 --gdn-prefill-backend triton --quantization fp8

  3. 意思決定APIの構築:
    付属の shim.py を使用して、意思決定に特化したAPIエンドポイントを構築します。 bash VLLM=http://localhost:8000/v1 TOKENIZER=./openjev \ READOUT_T=0.85 READOUT_NOUL_T=1.829074 READOUT_NOUL_BIAS=0 \ READOUT_TARGETED=1 READOUT_INSTR_STYLE=pyrepr SHIM_STAGGER=1 \ python openjev/helper/shim.py --host 127.0.0.1 --port 3000

  4. リクエストの実行:
    curl コマンド等を用いて、特定のテキストや画像に対する意思決定リクエストを送信できます。リクエストには、質問内容、選択肢、スコアリングの基準などをJSON形式で含めることができます。

資料が触れていないこと

本資料には、以下の情報が含まれていません。

  • テスト用モデル tinyopenjev-for-testing-gguf が出力する「意味のない内容」の具体的なテキスト例や、どのような挙動を示すのかについての詳細な説明はありません。
  • GGUF形式に量子化されたモデルの精度について、10,000問のフルセットを用いたベンチマーク結果は示されておらず、1,789問のサブセットによる測定も「現時点でのデータ」としての扱いに留まっています。
  • H100以外の一般的なコンシューマー向けGPU(例:NVIDIA GeForce RTXシリーズ)における、具体的な推論レイテンシやスループットの測定データは記載されていません。
  • 商用ライセンスを取得する際の具体的なコストや、サポート体制の詳細については触れられていません。
  • チューニング前のベースモデルとOpenJevの間で行われた、具体的な学習データセットの内容や学習時間については明記されていません。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 27.4B(元モデル openjev/openjev の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
4GB(ノートPCの内蔵GPU・スマートフォンなど) Q8_0 0.0GB 0.1GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

関連記事

次に読むなら

出典