AIが2倍速く動く新モデル登場
Meet Nemotron Labs 3 Puzzle 75B A9B: A Compressed Hybrid MoE LLM Delivering 2.03x Server Throughput

NVIDIAが、既存の文章AIを圧縮して処理速度を2倍以上にした新モデルを発表。AIの運用コスト削減に貢献します。
Nemotron-3-Superのような大規模なハイブリッドMoEモデルは、精度は高いものの、運用コストがかかります。それらのアクティブパラメータ、KV cache、Mamba stateが、特定のユーザーごとのトークンレートにおいて、1つのノードが処理できるユーザー数を制限しています。NVIDIA AIチームは、Nemotron-3-Superの圧縮版であるNemotron-Labs-3-Puzzle-75B-A9Bをリリースしました。元のモデルは、合計120.7Bのパラメータと12.8Bのアクティブパラメータを持っています。圧縮されたモデルは、合計75.3Bのパラメータと9.3Bのアクティブパラメータを持っています。アーキテクチャ探索を開始する前に、デプロイメントの目標が設定されていました。目標1は、ユーザーあたり毎秒100トークンで2倍のサーバーthroughputでした。目標2は、単一のH100で8つの同時1Mトークンリクエストでした。Hugging Faceには、BF16、FP8、NVFP4の3つのチェックポイントがあります。要するに、120.7B/12.8Bのアクティブパラメータが75.3B/9.3Bのアクティブパラメータに圧縮され、88ブロックのハイブリッドレイアウトは維持されています。8xB200の合計throughputは、NVFP4とユーザーthroughputを一致させた場合、Superと比較して1.60倍から2.14倍に向上します。単一のH100における1Mトークンの同時実行数は、70GBから44.5GBへの重み削減により、1から8に増加します。反復的なPuzzleは、同じ圧縮目標において、単一ステップのPuzzleを平均0.57ポイント上回ります。Arena-Hard-V2 (-4.2)とSWE-Bench (-2.6)が実際のコストであり、RULERとAA-LCRはほとんど動きません。Nemotron-Labs-3-Puzzle-75B-A9B Nemotron-3-Superは、ハイブリッドMamba-Transformer MoEモデルです。Puzzle-75B-A9Bは、元のモデルのブロックレイアウトを完全に維持しています。これは88のブロックで構成されており、40のMambaブロック、40のMoEブロック、8つのattentionブロックがあります。変更されたのは、これらのブロック内の容量です。 数量 Super Puzzle-75B-A9B 比率 合計パラメータ 120.7B 75.3B 62.4% アクティブパラメータ 12.8B 9.3B 73.1% Mamba SSM stateサイズ 128 96 75% MoEルーティングされたエキスパート中間サイズ 2688 1280-2688 平均59.9% トークンあたりアクティブなルーティングされたエキスパート数 22 4-18 平均50% アクティブなルーティングされたエキスパート容量(相対) 100% 8.7%-62.3% 平均30.9% ルーティングされたエキスパートの数、共有エキスパートサイズ、MoE潜在サイズは変更されていません。Attention層は手付かずのままでした。この研究が提案された理由は、Nemotron-3-Superがすでに非常にKV-cache効率が良いからです。Mamba l
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。