Google、文章生成AIを高速化
Google AI Releases DiffusionGemma, a 26B MoE Open Model Using Text Diffusion for Up to 4x Faster Generation

Googleが文章を最大4倍速く生成する新しいAI「DiffusionGemma」を公開。品質は劣るものの、高速性が求められる作業で役立ちます。
Google DeepMindの研究者を含むGoogle AIチームは、テキスト生成用の実験的なオープンモデルであるDiffusionGemmaをリリースしました。これは、標準的なautoregressive decodingの代わりにtext diffusionを使用しています。このモデルは、寛容なApache 2.0ライセンスの下で提供されます。Googleは、速度が重視されるインタラクティブなローカルワークフローを探求する開発者や研究者向けに位置付けています。例としては、インライン編集、迅速な反復、非線形なテキスト構造の生成などが挙げられます。現在使用されているほとんどの言語モデルはautoregressiveです。これらは一度に1つのトークンを左から右へ生成します。各新しいトークンは、その前のトークンに依存します。DiffusionGemmaは異なる動作をします。テキストのブロック全体を同時に、並行して生成します。専用GPUでは、これにより最大4倍速い生成が可能です。DiffusionGemmaとはDiffusionGemmaは26B Mixture of Experts (MoE) モデルです。推論時には3.8Bのパラメータのみをアクティブにします。これはGemma 4のバックボーン、具体的には26B-A4Bアーキテクチャに基づいて構築されています。Googleはそのベースにdiffusion headを統合しました。このモデルはマルチモーダルです。テキスト、画像、ビデオの入力が混在したものを処理します。これらの入力からテキスト出力を生成します。コンテキストウィンドウは256Kトークンで、140以上の言語をサポートしています。量子化された場合、このモデルは18GBのVRAM内に収まります。これにより、ハイエンドのコンシューマーGPUの制限内に収まります。単一のNVIDIA H100では、1秒あたり1000以上のトークンに達します。NVIDIA GeForce RTX 5090では、1秒あたり700以上のトークンに達します。Googleはトレードオフについて非常に明確です。DiffusionGemmaは速度と並列レイアウト生成を優先します。その全体的な出力品質は標準のGemma 4よりも低いです。最高の品質が求められる本番作業には、Googleは依然としてautoregressiveなGemma 4を推奨しています。Text Diffusionの仕組みText diffusionは、その核となるアイデアをAI画像生成器から借りています。これらのモデルは視覚的なノイズから始まり、それを繰り返し洗練します。DiffusionGemmaはテキスト生成に同じパターンを適用します。このプロセスは3つの概念的な段階で実行されます。まず、モデルはランダムなキャンバスから開始し
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。