AIが長い文章を速く処理する新技術
MiniMax Sparse Attention (MSA): a Two-Branch Block-Sparse Attention Trained on a 109B-Parameter MoE With a 3T-Token Budget

MiniMaxがAIの長文処理を効率化する新技術「MSA」を発表。1090億パラメーターの大規模AIモデルが、大量の情報をより速く、低コストで扱えるようになり、AIの能力向上に貢献します。
MiniMaxは、Grouped Query Attention (GQA) を直接基盤としたスパースアテンション手法であるMSA (MiniMax Sparse Attention) をリリースしました。これは、長文コンテキストにおけるsoftmax attentionの二次コストというボトルネックを狙っています。MiniMaxの研究チームは、ネイティブなマルチモーダルデータで訓練された1090億パラメーターのMixture-of-Expertsモデル内でこれをテストしました。彼らはまた、推論カーネルをオープンソース化し、製品モデルであるMiniMax-M3を出荷しました。
MSA (MiniMax Sparse Attention) とは
MSA (MiniMax Sparse Attention) は、アテンションをインデックスブランチとメインブランチの2段階に分解します。インデックスブランチは、各クエリがどのkey-valueブロックを読み取るべきかを決定します。その後、メインブランチは、それらのブロックのみに対して正確なsoftmax attentionを実行します。選択はトークンごとではなく、ブロック粒度で行われます。デフォルトのブロックサイズはB k = 128トークンです。各クエリとGQAグループはk = 16ブロックを保持します。これにより、クエリごとの予算はkB k = 2,048 key-valueトークンに固定されます。2つのコスト構造は異なります。高密度なGQAアテンションは、クエリごとにO(N)(フルコンテキスト)でスケールします。MSAはO(kB k )でスケールし、これはNが増加しても固定されます。したがって、コンテキスト長が増加するにつれて計算ギャップは広がります。選択は各GQAグループ内で共有されますが、グループ間では独立しています。1つのkey-valueヘッドが複数のクエリヘッドにサービスを提供し、それらは1つのブロックセットを共有します。異なるグループは、異なる長距離領域にアテンションを向けることができます。
2つのブランチの仕組み
インデックスブランチは、標準的なGQAレイヤーに2つの射影行列を追加するだけです。GQAグループごとに1つのインデックスクエリヘッドと、共有のインデックスキーヘッドを1つ定義します。これは可視のキー・トークンをスコアリングし、そのスコアをブロックレベルで最大プーリングします。その後、Top-k演算子によって、クエリとグループごとに最もスコアの高いブロックが選択されます。クエリを含むローカルブロックは常に含まれます。これにより、セレクターがクエリのすぐ近くを削除するのを防ぎます。メインブランチは、選択されたブロックから因果的に可視なトークンを収集します。そして、それらのトークンに限定されたスケールドドット積softmax attentionを適用します。各クエリヘッドは独自のクエリpr
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。