Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開

Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開

基本情報

項目 内容
リポジトリ tencent/WeVisDoc-4B
公開日 2026-09-16
ライセンス apache-2.0
配布形式 safetensors
論文 arXiv:2609.20423
出典の種類 公開元の一次情報(公式HFリポジトリとGitHubから一次情報確認)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

Tencentは、ページ画像から構造化テキストを抽出するエンドツーエンドのドキュメント解析モデル「WeVisDoc-2B」および「WeVisDoc-4B」を公開しました。

本モデルは「Qwen3-VL-2B-Instruct」および「Qwen3-VL-4B-Instruct」をベースにファインチューニングされたもので、ページ画像を入力としてLaTeX形式の数式やHTML形式の表を含む構造化Markdownを出力します。

スペック

  • アーキテクチャ: Qwen3VLForConditionalGeneration (qwen3_vl)
  • ベースモデル: Qwen3-VL-2B-Instruct、Qwen3-VL-4B-Instruct
  • ライセンス: apache-2.0

性能

公開元が提示しているドキュメント解析ベンチマークの測定結果は以下の通りです。評価値は3回の推論実行の平均値となっています。

OmniDocBench v1.6

→ 横にスクロールできます

Model Params Overall ↑ TextEdit ↓ FormulaCDM ↑ TableTEDS ↑ TableTEDS_S ↑ ROEdit ↓
Nanonets-OCR2* 3B 83.20 0.108 80.35 80.10 85.26 0.211
OCRFlux-3B* 3B 83.31 0.126 88.75 73.78 77.98 0.217
POINTS-Reader 3B 83.37 0.096 85.72 73.98 77.40 0.198
Nanonets-OCR-s 3B 83.61 0.108 81.46 80.18 84.51 0.213
olmOCR-2-7B* 7B 85.51 0.106 88.84 78.32 82.81 0.223
olmOCR 7B 85.74 0.139 88.10 83.00 87.17 0.216
DeepSeek-OCR* 3B 86.31 0.077 84.71 81.87 86.07 0.171
OCRVerse 4B 88.60 0.063 89.61 82.44 86.27 0.163
UniRec-0.1B* 0.1B 88.91 0.088 92.14 83.40 86.79 0.146
DeepSeek-OCR 2 3B 90.25 0.050 91.84 83.89 87.75 0.144
dots.ocr 3B 90.77 0.048 89.95 87.18 90.58 0.138
FD-RL* 4B 91.21 0.055 92.92 86.22 90.92 0.145
HunyuanOCR 1B 92.03 0.048 88.60 92.37 93.99 0.138
dots.mocr* 3B 92.57 0.042 92.09 89.78 92.92 0.133
FireRed-OCR 2B 93.26 0.037 95.44 88.04 91.06 0.131
Logics-Parsing-v2 4B 93.33 0.041 95.65 88.42 91.98 0.137
Qianfan-OCR 4B 93.90 0.040 95.08 90.53 93.31 0.130
Unlimited-OCR 3B-A0.5B 93.92 0.042 95.79 90.16 93.32 0.129
HunyuanOCR-1.5 1B 94.74 0.039 94.50 93.67 94.71 0.129
WeVisDoc-2B 2B 95.06 0.038 95.94 93.03 95.26 0.130
WeVisDoc-4B 4B 95.38 0.036 96.81 92.95 95.34 0.125

PureDocBench

→ 横にスクロールできます

Model Params Avg₃ ↑ Clean Overall ↑ Digital Degraded Overall ↑ Real Degraded Overall ↑
OCRFlux-3B 3B 42.06 47.14 41.82 37.21
DeepSeek-OCR 3B 46.98 53.50 46.95 40.48
UniRec-0.1B 0.1B 48.59 58.91 52.42 34.44
POINTS-Reader* 3B 49.24 53.78 51.24 42.69
DeepSeek-OCR-2 3B 49.51 55.53 49.41 43.60
Qianfan-OCR 4B 51.04 57.22 50.85 45.06
olmOCR-7B 7B 55.90 62.56 57.84 47.30
Nanonets-OCR2 3B 58.36 64.83 61.23 49.03
HunyuanOCR 1B 60.56 65.61 61.49 54.58
Unlimited-OCR* 3B-A0.5B 62.76 71.28 63.62 53.39
olmOCR-2-7B 7B 63.78 69.36 65.87 56.10
dots.ocr 3B 64.55 72.01 65.95 55.68
Nanonets-OCR-s* 3B 65.37 71.26 66.56 58.28
FireRed-OCR 2B 65.57 70.81 68.49 57.42
HunyuanOCR-1.5* 1B 68.79 73.98 70.81 61.59
OCRVerse 4B 69.40 73.18 71.36 63.66
dots.mocr 3B 70.39 76.27 73.16 61.73
Logics-Parsing-v2 4B 72.61 76.35 73.85 67.64
FD-RL 4B 73.92 78.38 76.33 67.04
WeVisDoc-2B 2B 73.86 79.36 76.62 65.60
WeVisDoc-4B 4B 75.54 79.81 77.74 69.08

モデルカードに記載された測定結果によると、WeVisDoc-4BはOmniDocBench v1.6のOverall(95.38)およびPureDocBenchの3トラック平均Avg₃(75.54)の両方において、比較対象のエンドツーエンドパーサーの中で最高のスコアを獲得しています。 特にOmniDocBench v1.6のFormulaCDM(96.81)やPureDocBenchのClean Overall(79.81)で極めて高い数値を示しており、数式や標準的なドキュメント画像の解析精度において優れています。 小型版のWeVisDoc-2Bも非常に優秀で、OmniDocBench v1.6のOverallで95.06を記録し、HunyuanOCR-1.5やLogics-Parsing-v2などの大型・他モデルを上回っています。 一方で、PureDocBenchの「Real Degraded Overall」においてはWeVisDoc-2Bが65.60にとどまり、FD-RL(67.04)やLogics-Parsing-v2(67.64)を下回るなど、撮影劣化を伴うリアル画像への耐性において上位の4B版と差が見られます。

得意なこと・想定用途

WeVisDocは書籍や論文、各種資料などのページ画像(PNG、JPEG、WebP)から、構造化されたMarkdownを生成することに特化しています。 本文テキストの変換だけでなく、LaTeX形式による数式の抽出やHTML形式による表構造の解析を得意としています。 タグ情報として英語(en)および中国語(zh)が設定されており、多言語ドキュメントのOCR・ペーパーパーシング用途が想定されます。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 4.4B

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4070 / 3060 12GB など 12GB BF16 9.0GB 10.8GB

推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-18 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

入手方法

モデルファイルはsafetensors形式で配布されており、Hugging Faceより直接取得可能です。

vLLM(>=0.11.1)を使用してサーバーを起動する場合のスクリプト実行例は以下の通りです。

bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B

※4Bモデルを使用する場合は Tencent/WeVisDoc-4B を指定します。

サービス起動後、付属のクライアントを用いて画像を解析するコマンド例です。

python -m wevisdoc.client --image page.png --output results/page.md

また、Transformersを用いたローカル推論環境でも直接実行することができます。

python -m wevisdoc.local --model Tencent/WeVisDoc-2B --image page.png --output results/page.md

関連記事

出典