シャオミのAI、超高速で文章生成
Xiaomi MiMo and TileRT Push a 1-Trillion-Parameter Model Past 1000 Tokens Per Second on Commodity GPUs

シャオミは一般的な高性能コンピューターで、大規模なAIが1秒間に1000文字以上を生成する技術を開発。これにより、超巨大AIの利用がより身近になる。
大規模言語モデルにとって、推論速度は競争力のある指標になりつつあります。XiaomiのMiMoチームは、TileRTシステムグループとの共同開発により、MiMo-V2.5-Pro-UltraSpeedをリリースしました。これは1兆パラメータのモデルで1秒あたり1000トークン以上の速度でデコードします。Xiaomiチームはこれを1兆パラメータ規模での初の快挙と説明しています。デモでは、生成速度が1秒あたり1200トークン近くに達するピークを示しています。注目すべき点はハードウェアで、カスタムチップではなく一般的なGPUで動作します。 MiMo-V2.5-Pro-UltraSpeedとは UltraSpeedは、既存のMiMo-V2.5-Proモデル向けの高速提供モードです。ベースモデルは、1兆パラメータ規模のMixture-of-Experts (MoE) アーキテクチャを使用しています。UltraSpeedはモデルの能力よりも生成速度を重視しており、モデルが出力トークンを生成する速度を変更します。この速度向上は、モデルと提供システムにわたる3つの連携した技術によって実現されています。Xiaomiはこのアプローチを「極限のモデル・システム協調設計」と呼んでいます。重要なのは、スタック全体が単一の標準的な8-GPUコモディティノードで動作することです。 速度向上のケース:3つの層の連携 最初の層はFP4 quantizationです。1兆規模では、FP8やFP16の重みはメモリと帯域幅に大きな負荷をかけます。より低いビット幅の重みはメモリをより速く移動するため、デコード速度を直接向上させます。XiaomiはMXFP4形式を使用し、MoE Expertsにのみ選択的に適用しています。他のモジュールはより高い精度を維持しており、TileRTによってFP8と報告されています。Expertsはほとんどのパラメータを保持し、quantizationを最もよく許容するため、このトレードオフは有利です。Quantization-Aware Training (QAT) により、ベンチマーク品質は元のモデルと実質的に同等に保たれています。 2番目の層はDFlash speculative decodingで、詳細は以下で説明します。 3番目の層は、GPU上で全てを実行するシステムであるTileRTです。 それぞれの技術だけでは十分ではありません。1000 TPSの結果には、これら3つが密接に連携している必要があります。 DFlash: シリアルボトルネックなしの並列ドラフティング 標準的なspeculative decodingは、小さなドラフトモデルを使用して次のトークンを推測します。その後、大規模モデルがv
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。