NVIDIAが小さく速いAIを公開
NVIDIA Releases Nemotron-Labs-3-Puzzle-75B-A9B: A Compressed Hybrid MoE LLM Delivering 2.03x Server Throughput at Matched User Throughput

NVIDIAは文章AIを小さく圧縮し、処理速度を2.03倍に向上させました。これにより、同じコンピューターでより多くの人がAIを使えるようになり、効率的な運用が可能になります。
Nemotron-3-Superのような大規模なハイブリッドMoEモデルは正確ですが、提供するには費用がかかります。それらのactive parameters、KV cache、およびMamba stateは、特定のユーザーあたりのトークンレートでノードが保持できるユーザー数を制限します。NVIDIA AIチームは、Nemotron-3-Superの圧縮版であるNemotron-Labs-3-Puzzle-75B-A9Bをリリースしました。元のモデルは合計120.7B、active parametersは12.8Bです。圧縮されたモデルは合計75.3B、active parametersは9.3Bです。アーキテクチャの探索が始まる前に、デプロイメントターゲットが設定されていました。ターゲット1は、ユーザーあたり毎秒100トークンで2倍のサーバー処理能力でした。ターゲット2は、単一のH100で8つの同時1Mトークンリクエストでした。Hugging FaceにはBF16、FP8、およびNVFP4の3つのチェックポイントがあります。TL;DR: 120.7B/12.8B activeが75.3B/9.3B activeに圧縮され、88ブロックのハイブリッドレイアウトは維持されています。8xB200の合計処理能力は、NVFP4とユーザー処理能力が一致した場合、Superと比較して1.60倍から2.14倍に向上します。単一のH100での1Mトークン同時実行数は、70GBから44.5GBへの重み削減により、1から8に増加します。反復的なPuzzleは、同じ圧縮ターゲットで単一ステップのPuzzleを平均0.57ポイント上回ります。Arena-Hard-V2 (-4.2)とSWE-Bench (-2.6)が実際のコストであり、RULERとAA-LCRはほとんど動きません。Nemotron-Labs-3-Puzzle-75B-A9B Nemotron-3-SuperはハイブリッドMamba-Transformer MoEモデルです。Puzzle-75B-A9Bは、元のブロックレイアウトを完全に保持しています。40個のMamba、40個のMoE、8個のattentionブロックの合計88個のブロックがあります。変更されたのは、これらのブロック内の容量です。 数量 Super Puzzle-75B-A9B 比率 合計パラメータ数 120.7B 75.3B 62.4% アクティブパラメータ数 12.8B 9.3B 73.1% Mamba SSM状態サイズ 128 96 75% MoEルーティングされたエキスパート中間サイズ 2688 1280-2688 平均 59.9% トークンあたりにアクティブ化されたルーティングされたエキスパート数 22 4-18 平均 50% アクティブなルーティングされたエキスパート容量(相対) 100% 8.7%-62.3% 平均 30.9% ルーティングされたエキスパートの数、共有エキスパートのサイズ、MoE潜在サイズは変更されていません。Attention層は手付かずのままです。提案された研究の理由として、Nemotron-3-Superがすでに非常にKV-cache効率的であることが挙げられています。Mamba l
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。