AIの記憶圧縮技術が進化
The KV Cache Compression Race: TurboQuant vs OSCAR vs EpiCache

AIが長い文章を記憶する際のメモリ消費を大幅に減らす新技術が開発され、AIの処理速度向上とコスト削減に貢献します。
長い文章を扱う大規模言語モデル(LLM)は、モデルの重みとは関係のないメモリのボトルネックに直面しています。デコーディング中、Transformerは各レイヤーの各トークンについてキー(key)とバリュー(value)のベクトル(KVキャッシュ)をキャッシュし、アテンション(attention)を再計算する必要がないようにします。このキャッシュはシーケンス長とバッチサイズに比例して増加し、長いコンテキストで高い並行処理を行う場合、モデル自体のフットプリントをはるかに超えることがあります。BF16のLlama-3.1-70Bを考えてみましょう。そのKVキャッシュは1トークンあたり約0.31 MBかかります(80レイヤー × 8 KVヘッド × 128ヘッド次元 × 2テンソル × 2バイト)。128Kトークンでは約40 GB、1Mトークンでは300 GBを超え、これはモデル自体の重み140 GBよりも大きいです。さらに悪いことに、新しくデコードされるすべてのトークンは、高帯域幅メモリ(HBM)からキャッシュ全体をストリームする必要があり、これによりデコーディングは計算能力ではなくメモリ帯域幅によって制限されます。したがって、KVキャッシュを縮小することは、コストとデコードの遅延の両方を削減するための最も直接的な手段です。現在の手法は、大まかに5つのカテゴリに分類されます。トークン削除(token eviction)(H2O、SnapKV)、量子化(quantization)(KIVI、GEAR)、低ランク射影(low-rank projection)(Palu)、マージ(merging)(KVMerger)、およびアーキテクチャ共有(architectural sharing)(MLA)です。最近の2026年の研究では、超低ビット量子化の最前線が強く推進されています。GoogleとNYUのTurboQuant(ICLR 2026)およびTogether AIのOSCARは、同じ問題に異なる方向からアプローチしており、AppleのEpiCacheは、どちらも対処していない問題に取り組んでいます。ほとんどのKV量子化器は、同じ根本的な敵と戦っています。それは「外れ値チャネル(outlier channels)」です。これは、不釣り合いに大きな値を持つ少数のチャネルで、量子化範囲を支配し、残りの信号をわずかな表現可能なレベルに押し込めてしまいます。これが、単純なINT2量子化(わずか4レベル)がほぼゼロの精度に崩壊する理由です。KIVIはここで標準的なベースラインを確立しました。KIVIは、キーベクトル(key vectors)はトークン間で固定の外れ値チャネルを持つが、バリューベクトル(value vectors)は持たないことを示しました。そのため、キーはチャネルごとに、バリューはトークンごとに量子化します。このチューニング不要な2ビットの手法は、エンドツーエンドのピークメモリ(重みを含む)を削減します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。