画像と文章を理解するAIが高速化
Zyphra Release Zamba2-VL: Hybrid Mamba2–Transformer Vision-Language Models That Cut Time-to-First-Token by About an Order of Magnitude

Zyphraが画像と文章を理解するAI「Zamba2-VL」を発表。AIが最初に答えを出すまでの時間が約10倍速くなり、より快適に使えるようになります。
Zyphraは、オープンなvision-language modelsのファミリーであるZamba2-VLをリリースしました。このリリースには、1.2B、2.7B、7Bパラメータの3つのサイズが含まれます。各モデルは、Zamba2ハイブリッドSSM–Transformerバックボーン上に構築されています。Vision-language models(VLM)は、画像とテキストを一緒に読み取ります。これらは、グラフ、ドキュメント、写真に関する質問に答えます。ほとんどのオープンVLMは、言語モデルとして密なTransformerを使用します。Zamba2-VLはこれをハイブリッドなstate-space設計に置き換えます。目標は、低いレイテンシで競争力のある精度を実現することです。Zamba2-VLとはZamba2-VLは、現在標準となっているLLaVAスタイルのVLMテンプレートに従っています。事前学習済みのvision encoderが画像パッチを特徴に変換します。軽量なMLP adapterがこれらの特徴を言語モデルの空間に投影します。その後、言語モデルはvisionとtextトークンが交互に並んだシーケンスを読み取ります。これらのモデルは、単一および複数画像の理解とグラウンディングをサポートしています。Zyphraは、各Zamba2バックボーンをQwen2.5-VLのVision Transformerと組み合わせています。このエンコーダは、2D rotary position embeddingsとネイティブなdynamic-resolution processingという2つの特定の特性のために選ばれました。2層のMLP adapterがエンコーダをバックボーンに接続します。https://www.zyphra.com/our-work/zamba2-vlアーキテクチャZamba2のバックボーンは、一般的なVLMとは設計が異なる点です。これは、Mamba2 state-space layersと共有Transformerブロックのハイブリッドです。Mamba2 layersは、固定サイズのstateで線形時間で実行されます。少数の共有attention layersがそれらの間に挟まれています。各共有ブロックは、各層でユニークなLoRA adapterを保持します。Mamba2 layersは、計算の大部分を安価に処理します。共有attention layersは、純粋なSSMモデルが失うin-context retrievalを保持します。このハイブリッドは、full-attentionの表現力とstate-spaceの効率性をトレードオフします。Zamba2-VLはMistral v0.1 tokenizerを使用しています。これは、オープンなウェブデータセットから取得された100Bトークンのvision-textおよび純粋なtextデータでトレーニングされました。https://www.zyphra.com/our-work/zamba2-vlモデルの品質とベンチマーク
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。