バイドゥ、長い文書を速く読むAI
Baidu Releases Unlimited OCR, a 3B Model That Keeps the KV Cache Flat for Long-Document Parsing

バイドゥの新しいAIは、記憶領域を効率的に使う技術で、何十ページもの長い文書も素早く読み込めるようになり、実用性が高まりました。
ほとんどのエンドツーエンドOCRモデルは、出力が増えるにつれて処理が遅くなります。生成される各トークンがKVキャッシュに追加され、メモリ使用量が増加し、生成が遅くなります。何十ページもの文書を解析することは非現実的になります。バイドゥのUnlimited OCRは、この問題に直接対処します。デコーダーのAttentionを、メモリを一定に保つ設計に置き換えています。要するに、Unlimited OCRは3B-parameterのMixture-of-Expertsモデルで、そのうち500Mパラメータのみがアクティブです。デコーダーのAttentionをReference Sliding Window Attention (R-SWA)に置き換え、KVキャッシュを一定に保ちます。このモデルは、最大32Kの長さで、何十ページもの文書を1回のフォワードパスで解析します。OmniDocBench v1.5で93.23点を獲得し、DeepSeek OCRのベースラインを6.22ポイント上回りました。これは、DeepSeek OCRをゼロから構築するのではなく、継続学習によって構築されています。何がUnlimited OCRなのか? Unlimited OCRはDeepSeek OCRをベースラインとしています。DeepEncoderとMixture-of-Expertsデコーダーを維持しています。MoE設計は合計3Bパラメータを持ちますが、推論時には500Mのみがアクティブになります。DeepEncoderは圧縮エンジンです。ウィンドウAttention下のSAM-ViTとグローバルAttention下のCLIP-ViTをカスケード接続します。ブリッジでは、16倍のトークン圧縮を適用します。1024×1024のPDF画像は、わずか256の視覚トークンになります。入力トークンが少ないほど、プリフィルが小さくなります。DeepEncoderは5つの解像度モードをネイティブにサポートしており、Unlimited OCRはそのうち2つを保持しています。「Base」モードはマルチページ作業用に1024×1024で実行されます。「Gundam」モードはシングルページ用に動的解像度を使用します。https://arxiv.org/pdf/2606.23050 R-SWAがキャッシュを一定に保つ方法 貢献はReference Sliding Window Attentionです。標準的なMulti-Head Attentionは、すべてのトークンに対してキーと値を保存します。出力長Tが伸びるにつれて、キャッシュもそれに伴って増大します。サイズはC MHA (T) = L m + Tとなり、メモリとレイテンシは際限なく上昇します。R-SWAはこの関連性を断ち切ります。生成される各トークンは、すべての参照トークン、つまり視覚トークンとプロンプトにAttentionを向けます。また、先行するn個の出力トークン(nはデフォルトで128)にもAttentionを向けます。それよりも古いものはすべて削除されます。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。