NVIDIA、文章生成AIを高速化
NVIDIA Releases Nemotron-Labs-TwoTower: an Open-Weight Diffusion Language Model Built on a Frozen Autoregressive Nemotron-3-Nano-30B-A3B Backbone

NVIDIAが新しい文章生成AIを公開。テキスト生成が2.42倍速くなり、品質もほぼ同じなので、AIの効率が大きく向上します。
NVIDIAは、事前に学習された自己回帰型のバックボーン上に構築された拡散言語モデルであるNemotron-Labs-TwoTowerをリリースしました。これはNVIDIA Nemotron Open Model Licenseの下でオープンウェイトとして提供されます。このリリースは、テキスト生成におけるスループットのボトルネックを解消することを目的としています。自己回帰型(AR)モデルは一度に1つのトークンをデコードします。この逐次的なプロセスが生成スループットの上限となります。離散拡散言語モデルは別の方法を取ります。それらはトークンを並行して生成し、反復的に洗練します。ほとんどの拡散言語モデルは、2つのタスクに1つのネットワークを使用します。それは、クリーンなトークンを表現し、各ステップで破損したトークンをノイズ除去します。TwoTowerはこれらのタスクを2つの「タワー」に分離します。これにより、ARベースラインの集計ベンチマーク品質の98.7%を維持します。また、実測の生成スループットは2.42倍高いと報告されています。
TL;DR TwoTowerは拡散を、凍結されたARコンテキストタワーと、訓練されたデノイザータワーに分割します。これにより、2.42倍のスループット(γ=0.8, S=16, 2×H100)でAR品質の98.7%を保持します。デノイザーは約2.1兆トークンで訓練され、バックボーンは25兆トークンを使用しました。1つのチェックポイントで、拡散、モックAR、ARデコードモードを実行します。
Nemotron-Labs-TwoTowerは、ブロック単位の自己回帰拡散モデルです。これは、オープンウェイトのハイブリッドバックボーンであるNemotron-3-Nano-30B-A3B上にインスタンス化されています。このバックボーンは、Mamba-2、self-attention、およびmixture-of-experts(MoE)レイヤーを交互に配置しています。各タワーは52層で構成されており、Mamba-2が23層、self-attentionが6層、MoEが23層です。リリースされたチェックポイントには両方のタワーが含まれており、合計で約600億のパラメータがあります。トークンあたりのアクティブなパラメータは、各タワーあたり約30億です。MoEは128個のルーティング可能なエキスパートを使用し、そのうち6個がアクティブになり、さらに2個の共有エキスパートがあります。両方のタワーは同じバックボーンチェックポイントのコピーとして開始されます。デノイザータワーのみが訓練されます。ARコンテキストタワーは凍結されたままです。デノイザーは約2.1兆トークンで訓練されましたが、これはバックボーンの25兆トークンの事前学習の一部です。
2つのタワーの動作 ARコンテキストタワーは、プロンプトとコミットされたトークンに対して因果的に実行されます。これは、レイヤーごとのKVキャッシュと最終的なMamba-2の状態を生成します。これはb
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。