NVIDIAが音声と文章両方できるAI「Audex」を発表
NVIDIA Releases Audex (Nemotron-Labs-Audex-30B-A3B): A Unified Audio-Text LLM That Preserves the Text Intelligence of Its Backbone

NVIDIAが音声と文章を同時に扱えるAI「Audex」を発表。音声対応しても文章を書くAIの能力が落ちないため、より賢い対話が可能になります。
NVIDIAは、統合された音声・テキストの大規模言語モデルであるAudex (Nemotron-Labs-Audex-30B-A3B) をリリースしました。これは音声と発話の両方を理解し、生成します。また、そのbackboneのテキストの知能も維持しています。チェックポイントは、より小型のAudex-2Bとともに、非商用ライセンスの下で公開されています。ほとんどのマルチモーダルモデルは「テキスト税」を支払います。研究室が音声や視覚の出力を追加すると、テキストのベンチマークがしばしば低下します。NVIDIAの研究チームは、音声のみの出力モデルでもこの現象を報告しています。Audexはそのような退行を避けるように設計されています。TL;DR Audexは音声の入出力を扱う単一の30B-A3B MoEモデルです。音声入力はテキスト embedding spaceに入り、音声出力はテキストトークンのように扱われます。テキストスコアはbackboneと一致し、ベンチマークごとにわずかな向上とわずかな損失があります。多段階のSFTとテキストのみのCascade RLにより、通常のマルチモーダルテキストの退行を回避します。これは、発話以外の一般的な音声を生成する数少ないオープンモデルの一つです。Audexとは? Audexは単一のMixture-of-Experts (MoE) Transformerデコーダーです。合計30Bのパラメータを持ち、トークンごとに3Bが活性化されます。backboneはテキストのみのMoE LLMであるNemotron-Cascade-2-30B-A3Bです。このbackboneは52層のハイブリッドMamba-Transformerであり、128のルーティング可能なエキスパートと6つの活性化されたエキスパートを使用しています。設計は意図的にシンプルです。音声入力はエンコードされ、テキスト embedding spaceに投影されます。その後、テキストトークンと量子化された音声トークンは、生成中に均一に扱われます。思考者と発話者の分離や、モデルの積み重ねられたカスケードはありません。設計がシンプルなため、Audexは標準的なLLMスタックで動作します。これには、トレーニング用のMegatron-LMと推論用のvLLMが含まれます。instruct modeとthinking modeの両方をサポートしています。コンテキスト長は1Mトークンに達します。統合された設計の仕組み LLM backboneの周りには3つのコンポーネントがあります。音声エンコーダーは音を読み取ります。AudexはAudio Flamingo 3のAF-Whisperを使用しています。これはWhisper Large-v3アーキテクチャを共有し、16kHzの入力を処理します。2層のMLPアダプターは音声特徴をモデルの次元にマッピングします。An
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。