新しい独英対応AIモデル公開
Soofi Consortium Releases Soofi S 30B-A3B: An Open Hybrid Mamba-Transformer MoE Foundation Model For German And English

ドイツの研究グループが、独英で高性能なオープンAIモデル「Soofi S」を公開。異なるAIの仕組みを組み合わせ、誰でも使える点が重要です。
ドイツの研究コンソーシアムが、Soofi S 30B-A3Bの事前学習レポートを公開しました。これはドイツ語と英語に対応したオープンな基盤モデルです。学習は、ミュンヘンにあるDeutsche TelekomのIndustrial AI Cloudで最初から最後まで行われました。プレビュー版の重みはHugging Faceで公開されています。特筆すべきは、テストされたいくつかの完全オープンな基盤モデルの中で、Soofi Sが英語とドイツ語の合計スコアで最高を記録したことです。Soofi S 30B-A3Bとは何でしょうか?Soofi Sは、Mixture-of-Experts (MoE)のハイブリッドなMamba Transformer基盤モデルです。これは合計で約316億のパラメータを持ち、トークンごとに約32億のパラメータが活性化されます。基盤モデルとして、命令チューニング、アライメント、安全性チューニングは行われていません。KI Bundesverbandがこのコンソーシアムを調整しており、ドイツ連邦経済エネルギー省から資金提供を受けています。参加機関には、Fraunhofer IAIS、DFKI、TU Darmstadt、ellamind、Merantix Momentumが含まれます。アーキテクチャはどのように機能するのでしょうか?効率性の主張はレイヤースタックから始まります。ネットワークは52層で構成されています。それは23のMamba-2シーケンス混合層、23の粒状MoE層、そして6のGrouped-Query Attention (GQA)層です。これらの6つのGQA層のみがKVキャッシュを維持します。各MoE層は128のルーティングされたエキスパートを保持し、トークンごとに6つを活性化し、2つの共有エキスパートを追加します。その他の詳細:モデル次元2688、squared ReLU、RMSNorm、そして位置埋め込みなし。Soofi Sは、Nemotron 3 Nanoの参照設計を修正なしで採用しています。研究チームはその選択について3つの理由を挙げています。それらは、vLLMのようなスタックへのデプロイ可能性、サービス効率、そして科学的制御です。バックボーンが固定されているため、Nemotron 3 Nanoはアーキテクチャ的に同一のベースラインとなります。データレシピが唯一の可動部分です。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。