美団、長文に強いAI「LongCat-2.0」公開
Meituan Releases LongCat-2.0: A 1.6T-Parameter Open MoE Model with Native 1M Context and LongCat Sparse Attention

美団が100万文字の長文を処理できる1.6兆の部品を持つAI「LongCat-2.0」を公開。プログラミング作業の自動化を目指し、国産チップで安定稼働した点が注目されます。
Meituanは、大規模なMixture-of-Experts(MoE)言語モデルであるLongCat-2.0をリリースしました。これは合計1.6兆のパラメーターを持ち、トークンあたり約480億のパラメーターを活性化します。このモデルは、エージェントワークフロー内でのコード理解、生成、実行といったagentic codingをターゲットとしています。2つの事実が際立っています。第一に、LongCat-2.0はネイティブな100万トークンのコンテキストウィンドウをサポートしています。第二に、トレーニングとサービングの両方が完全に国内のAI ASICスーパーポッド上で実行されました。LongCat-2.0とは何でしょうか?LongCat-2.0は、Meituanの次世代の兆パラメーターオープンモデルです。これは、2025年にリリースされた560BモデルであるLongCat-Flashに続くものです。このアーキテクチャは、信頼性が高く効率的なagentic codingという1つの目標を中心に設計されました。事前学習は、数百万アクセラレータ時間にわたり35兆トークン以上で行われました。Meituanは、実行中にロールバックや回復不能な損失の急増はなかったと報告しています。この安定性の主張は、ツールが未成熟な非Nvidiaハードウェアにおいて重要です。アーキテクチャ:1.6兆モデルが低コストで稼働し続ける方法。この設計は、スケールのコストを削減する4つのアイデアを組み合わせています。それぞれが単独で理解する価値があります。Zero-computation experts:すべてのトークンが重い計算を必要とするわけではありません。句読点のような単純なトークンは、zero-computation expertにルーティングされ、変更されずに返されます。複雑なトークンは、より多くのexpert容量を使用します。PIDコントローラーがexpertバイアスを調整し、平均を範囲内に保ちます。これにより、固定コストではなく、33B~56Bの動的アクティベーションウィンドウが生成されます。MoEバックボーンは、より高いスループットのためにshortcut-connected design(ScMoE)を使用しています。LongCat Sparse Attention(LSA):標準的なattentionは、コンテキスト長に対して2乗でスケールします。LSAは最も関連性の高いトークンのみを選択し、スケールを線形に近づけます。MeituanはこれをDeepSeek Sparse Attention(DSA)の進化形と説明しています。これは3つの直交するインデックス作成方法を重ねています。Streaming-aware Indexingは、断片化されたメモリ読み取りを連続したブロックに変換します。Cross-Layer Indexingは、隣接するレイヤー間でattentionの顕著性を再利用します。Hierarchical Indexingは、粗密な2段階の
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。