Moonshot AIが新AI発表
Moonshot AI Releases Kimi K3: A 2.8 Trillion Parameter Open MoE Model With Kimi Delta Attention and 1M Context

Moonshot AIが、2.8兆の頭脳を持つ巨大なAI「Kimi K3」を発表しました。これは、長い文章を効率よく扱える世界初の公開AIモデルで、他の公開AIを上回る性能を持ちます。
Moonshot AIはKimi K3をリリースしました。これは2.8兆のパラメーターを持つモデルで、ネイティブな視覚能力と100万トークンのコンテキストウィンドウを備えています。Moonshotはこれを世界初のオープンな3Tクラスモデルと呼んでいます。Kimi K3とは何でしょうか?Kimi K3は、Kimi Delta Attention (KDA)とAttention Residuals (AttnRes)という2つのアーキテクチャ更新に基づいて構築された疎なMixture-of-Experts (MoE)モデルです。これらはいずれも、シーケンス長とモデルの深さ全体で情報がどのように流れるかを変えます。K3は、長期的なコーディング、知識作業、推論をターゲットとしています。Moonshotチームは、K3が2.8兆パラメーターに達した最初のオープンモデルであると述べています。過去12ヶ月のうち9ヶ月間、Kimiモデルはオープンモデルサイズの最上限を設定してきました。MoonshotはK3の位置付けについても明確にしています。全体的な性能は、最も強力なプロプライエタリモデルであるClaude Fable 5やGPT 5.6 Solにはまだ及ばないものの、Moonshot独自の評価スイート全体では、K3はテストされた他のモデルを一貫して上回りました。https://www.kimi.com/blog/kimi-k3
Kimi Delta Attention (KDA)の基盤となるアーキテクチャは、ハイブリッド線形アテンションメカニズムです。Moonshotは、これにより100万トークンのコンテキストで最大6.3倍高速なデコーディングが可能になると述べています。AttnResはもう一つの軸である深さ方向で機能します。これは、表現を均一に蓄積するのではなく、深さ全体から選択的に表現を取得します。Moonshotは、AttnResが2%未満の追加コストで約25%高いトレーニング効率を提供すると述べています。疎性は3番目のレバーです。K3はStable LatentMoEを使用しており、896のエキスパートのうち16を効果的にアクティブ化します。この疎性では、ルーティングと最適化が主要な課題となります。Quantile Balancingは、ルータースコアの分位数からエキスパートの割り当てを直接導き出します。これにより、ヒューリスティックな更新や敏感なバランス調整ハイパーパラメーターが不要になります。Per-Head Muonは、アテンションヘッドを独立して最適化することでMuonを拡張します。Sigmoid Tanh Unit (SiTU)とGated MLAは、それぞれ活性化制御とアテンションの選択性を向上させます。これらの構造的変更には、洗練されたトレーニングとデータレシピが伴います。これらが合わさって、約2.5倍の全体的な改善をもたらします。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。