Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | tencent/WeVisDoc-4B |
| 公開日 | 2026-09-16 |
| ライセンス | apache-2.0 |
| 配布形式 | safetensors |
| 論文 | arXiv:2609.20423 |
| 出典の種類 | 公開元の一次情報(公式HFリポジトリとGitHubから一次情報確認) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Tencentは、ページ画像から構造化テキストを抽出するエンドツーエンドのドキュメント解析モデル「WeVisDoc-2B」および「WeVisDoc-4B」を公開しました。
本モデルは「Qwen3-VL-2B-Instruct」および「Qwen3-VL-4B-Instruct」をベースにファインチューニングされたもので、ページ画像を入力としてLaTeX形式の数式やHTML形式の表を含む構造化Markdownを出力します。
スペック
- アーキテクチャ: Qwen3VLForConditionalGeneration (qwen3_vl)
- ベースモデル: Qwen3-VL-2B-Instruct、Qwen3-VL-4B-Instruct
- ライセンス: apache-2.0
性能
公開元が提示しているドキュメント解析ベンチマークの測定結果は以下の通りです。評価値は3回の推論実行の平均値となっています。
OmniDocBench v1.6
→ 横にスクロールできます
| Model | Params | Overall ↑ | TextEdit ↓ | FormulaCDM ↑ | TableTEDS ↑ | TableTEDS_S ↑ | ROEdit ↓ |
|---|---|---|---|---|---|---|---|
| Nanonets-OCR2* | 3B | 83.20 | 0.108 | 80.35 | 80.10 | 85.26 | 0.211 |
| OCRFlux-3B* | 3B | 83.31 | 0.126 | 88.75 | 73.78 | 77.98 | 0.217 |
| POINTS-Reader | 3B | 83.37 | 0.096 | 85.72 | 73.98 | 77.40 | 0.198 |
| Nanonets-OCR-s | 3B | 83.61 | 0.108 | 81.46 | 80.18 | 84.51 | 0.213 |
| olmOCR-2-7B* | 7B | 85.51 | 0.106 | 88.84 | 78.32 | 82.81 | 0.223 |
| olmOCR | 7B | 85.74 | 0.139 | 88.10 | 83.00 | 87.17 | 0.216 |
| DeepSeek-OCR* | 3B | 86.31 | 0.077 | 84.71 | 81.87 | 86.07 | 0.171 |
| OCRVerse | 4B | 88.60 | 0.063 | 89.61 | 82.44 | 86.27 | 0.163 |
| UniRec-0.1B* | 0.1B | 88.91 | 0.088 | 92.14 | 83.40 | 86.79 | 0.146 |
| DeepSeek-OCR 2 | 3B | 90.25 | 0.050 | 91.84 | 83.89 | 87.75 | 0.144 |
| dots.ocr | 3B | 90.77 | 0.048 | 89.95 | 87.18 | 90.58 | 0.138 |
| FD-RL* | 4B | 91.21 | 0.055 | 92.92 | 86.22 | 90.92 | 0.145 |
| HunyuanOCR | 1B | 92.03 | 0.048 | 88.60 | 92.37 | 93.99 | 0.138 |
| dots.mocr* | 3B | 92.57 | 0.042 | 92.09 | 89.78 | 92.92 | 0.133 |
| FireRed-OCR | 2B | 93.26 | 0.037 | 95.44 | 88.04 | 91.06 | 0.131 |
| Logics-Parsing-v2 | 4B | 93.33 | 0.041 | 95.65 | 88.42 | 91.98 | 0.137 |
| Qianfan-OCR | 4B | 93.90 | 0.040 | 95.08 | 90.53 | 93.31 | 0.130 |
| Unlimited-OCR | 3B-A0.5B | 93.92 | 0.042 | 95.79 | 90.16 | 93.32 | 0.129 |
| HunyuanOCR-1.5 | 1B | 94.74 | 0.039 | 94.50 | 93.67 | 94.71 | 0.129 |
| WeVisDoc-2B | 2B | 95.06 | 0.038 | 95.94 | 93.03 | 95.26 | 0.130 |
| WeVisDoc-4B | 4B | 95.38 | 0.036 | 96.81 | 92.95 | 95.34 | 0.125 |
PureDocBench
→ 横にスクロールできます
| Model | Params | Avg₃ ↑ | Clean Overall ↑ | Digital Degraded Overall ↑ | Real Degraded Overall ↑ |
|---|---|---|---|---|---|
| OCRFlux-3B | 3B | 42.06 | 47.14 | 41.82 | 37.21 |
| DeepSeek-OCR | 3B | 46.98 | 53.50 | 46.95 | 40.48 |
| UniRec-0.1B | 0.1B | 48.59 | 58.91 | 52.42 | 34.44 |
| POINTS-Reader* | 3B | 49.24 | 53.78 | 51.24 | 42.69 |
| DeepSeek-OCR-2 | 3B | 49.51 | 55.53 | 49.41 | 43.60 |
| Qianfan-OCR | 4B | 51.04 | 57.22 | 50.85 | 45.06 |
| olmOCR-7B | 7B | 55.90 | 62.56 | 57.84 | 47.30 |
| Nanonets-OCR2 | 3B | 58.36 | 64.83 | 61.23 | 49.03 |
| HunyuanOCR | 1B | 60.56 | 65.61 | 61.49 | 54.58 |
| Unlimited-OCR* | 3B-A0.5B | 62.76 | 71.28 | 63.62 | 53.39 |
| olmOCR-2-7B | 7B | 63.78 | 69.36 | 65.87 | 56.10 |
| dots.ocr | 3B | 64.55 | 72.01 | 65.95 | 55.68 |
| Nanonets-OCR-s* | 3B | 65.37 | 71.26 | 66.56 | 58.28 |
| FireRed-OCR | 2B | 65.57 | 70.81 | 68.49 | 57.42 |
| HunyuanOCR-1.5* | 1B | 68.79 | 73.98 | 70.81 | 61.59 |
| OCRVerse | 4B | 69.40 | 73.18 | 71.36 | 63.66 |
| dots.mocr | 3B | 70.39 | 76.27 | 73.16 | 61.73 |
| Logics-Parsing-v2 | 4B | 72.61 | 76.35 | 73.85 | 67.64 |
| FD-RL | 4B | 73.92 | 78.38 | 76.33 | 67.04 |
| WeVisDoc-2B | 2B | 73.86 | 79.36 | 76.62 | 65.60 |
| WeVisDoc-4B | 4B | 75.54 | 79.81 | 77.74 | 69.08 |
モデルカードに記載された測定結果によると、WeVisDoc-4BはOmniDocBench v1.6のOverall(95.38)およびPureDocBenchの3トラック平均Avg₃(75.54)の両方において、比較対象のエンドツーエンドパーサーの中で最高のスコアを獲得しています。 特にOmniDocBench v1.6のFormulaCDM(96.81)やPureDocBenchのClean Overall(79.81)で極めて高い数値を示しており、数式や標準的なドキュメント画像の解析精度において優れています。 小型版のWeVisDoc-2Bも非常に優秀で、OmniDocBench v1.6のOverallで95.06を記録し、HunyuanOCR-1.5やLogics-Parsing-v2などの大型・他モデルを上回っています。 一方で、PureDocBenchの「Real Degraded Overall」においてはWeVisDoc-2Bが65.60にとどまり、FD-RL(67.04)やLogics-Parsing-v2(67.64)を下回るなど、撮影劣化を伴うリアル画像への耐性において上位の4B版と差が見られます。
得意なこと・想定用途
WeVisDocは書籍や論文、各種資料などのページ画像(PNG、JPEG、WebP)から、構造化されたMarkdownを生成することに特化しています。 本文テキストの変換だけでなく、LaTeX形式による数式の抽出やHTML形式による表構造の解析を得意としています。 タグ情報として英語(en)および中国語(zh)が設定されており、多言語ドキュメントのOCR・ペーパーパーシング用途が想定されます。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 4.4B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| RTX 4070 / 3060 12GB など 12GB | BF16 | 9.0GB | 10.8GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-18 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 登録あり。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
入手方法
モデルファイルはsafetensors形式で配布されており、Hugging Faceより直接取得可能です。
vLLM(>=0.11.1)を使用してサーバーを起動する場合のスクリプト実行例は以下の通りです。
bash scripts/serve_vllm.sh Tencent/WeVisDoc-2B
※4Bモデルを使用する場合は Tencent/WeVisDoc-4B を指定します。
サービス起動後、付属のクライアントを用いて画像を解析するコマンド例です。
python -m wevisdoc.client --image page.png --output results/page.md
また、Transformersを用いたローカル推論環境でも直接実行することができます。
python -m wevisdoc.local --model Tencent/WeVisDoc-2B --image page.png --output results/page.md

