WeVisDoc まとめ:必要VRAM・GGUF版
このモデルについて
WeVisDoc は、Tencent が公開した文書のページ画像を、構造付きのテキストに変換するモデルです。PDF のページやスキャン画像を1枚渡すと、見出し・段落の構造を保った Markdown に変換し、数式は LaTeX、表は HTML の表として書き出します。レイアウト検出・文字認識・表認識を別々のツールでつなぐのではなく、1つのモデルで最初から最後まで(end-to-end)行う方式です。
画像も読める言語モデル Qwen3-VL(2B・4B)を文書の読み取り用に調整したもので、WeVisDoc-2B と WeVisDoc-4B の2サイズがあります。
何がすごいのか
公開元は、比較した end-to-end の文書変換モデルの中で「4つの評価設定すべてで1位」としています。抜粋します。
| モデル | 規模 | OmniDocBench v1.6 総合 ↑ | PureDocBench 実写・劣化 ↑ |
|---|---|---|---|
| WeVisDoc-4B | 4B | 95.38 | 69.08 |
| WeVisDoc-2B | 2B | 95.06 | 65.60 |
| Logics-Parsing-v2 | 4B | 93.33 | 67.64 |
| FD-RL | 4B | 91.21 | 67.04 |
| HunyuanOCR-1.5 | 1B | 94.74 | 61.59 |
| Qianfan-OCR | 4B | 93.90 | 45.06 |
| dots.ocr | 3B | 90.77 | 55.68 |
| DeepSeek-OCR 2 | 3B | 90.25 | 43.60 |
| olmOCR-2-7B | 7B | 85.51 | 56.10 |
- きれいな文書では、上位のモデルはもう僅差です。 OmniDocBench の総合点は 94〜95 台に上位が集まっており、WeVisDoc の優位は 1ポイント未満です。
- モデルごとの差が大きく出るのは、写真で撮った・劣化した文書です。 PureDocBench の「Real Degraded」では、きれいな文書では僅差だった Qianfan-OCR が 45.06 まで下がる一方、WeVisDoc-4B は 69.08 を保っています。ただし、この評価で WeVisDoc-4B に迫るモデルもあり、Logics-Parsing-v2(67.64)・FD-RL(67.04)との差は 1.4〜2ポイントほどです。「劣化した文書に強いモデルの中で、最も良い」と読むのが正確です。
- 2B 版は、きれいな文書なら 4B 版とほぼ同じです。 総合 95.06 は 4B 版(95.38)と僅差です。一方、劣化した文書では 65.60 と、4B 版や上の2モデルに一歩譲ります。スマートフォンで撮った書類や古いスキャンが多いなら 4B 版を選ぶのが無難です。
比較対象の一部の値は公開元が自分で測り直したもので、ほかは各モデルの論文からの引用です。
手元で動かすときのポイント
- 4B・2B と小さいので、一般的な GPU で動かせる大きさです。 公式の手順では、vLLM でサーバーを立ててページ画像を送る使い方が案内されています。当サイトが追跡している GGUF 版などの変換版もあります(下の「派生版・量子化版」)。
- 用途は「読み取り」に特化しています。チャットで質問に答えるような汎用のモデルではありません。
- ライセンスは Apache-2.0 で、商用利用もできます。 技術レポートは arXiv:2609.20423 です。
出典: tencent/WeVisDoc-4B のモデルカード(2026-09-25 時点)。ベンチマークの数値は公開元が掲載した値です。
当サイトの記録とデータ
当サイトが WeVisDoc 系統について公開した記事(1本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | tencent/WeVisDoc-4B |
| 公開元 | Tencent |
| パラメータ数 | 4.4B |
| ライセンス(モデルカード) | apache-2.0 |
| 最小のVRAM階層 | 4GB |
| 記事数 | 1本 |
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 4.4B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 4GB(ノートPCの内蔵GPU・スマートフォンなど) | Q5_K_S | 2.9GB | 3.5GB |
| RTX 4060 / 3060 Ti など 8GB | Q8_0 | 4.4GB | 5.2GB |
| RTX 4070 / 3060 12GB など 12GB | F16 | 8.2GB | 9.9GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 ファイルサイズは変換版 mradermacher/WeVisDoc-4B-GGUF の配布ファイルの実測値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
公開元の配布形式は safetensors です。
ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。
量子化の圧縮率: Q5_K_S は実測 5.61 bit/weight で、元の16bitの重みの約35%のサイズです(配布ファイルの実サイズから当サイトが算出)。
配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-20 | mradermacher | GGUF | mradermacher/WeVisDoc-4B-GGUF | Q5_K_S 3.5GB(4GB VRAMで動作) |
| 2026-09-20 | mradermacher | GGUF(imatrix) | mradermacher/WeVisDoc-4B-i1-GGUF | Q5_K_S 3.5GB(4GB VRAMで動作) |
各リポジトリの量子化とファイルサイズ:
- mradermacher/WeVisDoc-4B-GGUF の量子化: Q2_K 1.7GB / Q3_K_S 1.9GB / Q3_K_M 2.1GB / Q3_K_L 2.2GB / IQ4_XS 2.3GB / Q4_K_S 2.4GB / Q4_K_M 2.5GB / Q5_K_S 2.9GB / Q5_K_M 2.9GB / Q6_K 3.4GB / Q8_0 4.4GB / F16 8.2GB
- mradermacher/WeVisDoc-4B-i1-GGUF の量子化: IQ1_S 1.1GB / IQ1_M 1.2GB / IQ2_XXS 1.3GB / IQ2_XS 1.4GB / IQ2_S 1.5GB / IQ2_M 1.6GB / Q2_K_S 1.6GB / Q2_K 1.7GB / IQ3_XXS 1.7GB / IQ3_XS 1.8GB / Q3_K_S 1.9GB / IQ3_S 1.9GB / IQ3_M 2.0GB / Q3_K_M 2.1GB / Q3_K_L 2.2GB / IQ4_XS 2.3GB / Q4_0 2.4GB / IQ4_NL 2.4GB / Q4_K_S 2.4GB / Q4_K_M 2.5GB / Q4_1 2.6GB / Q5_K_S 2.9GB / Q5_K_M 2.9GB / Q6_K 3.4GB
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-18 | tencent/WeVisDoc-4B | 新モデル | Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開 |
リポジトリ
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。