インターフェイズ、6言語対応の音声認識AIを公開
Interfaze Ships diffusion-gemma-asr-small, an Open-Source Diffusion ASR Model Transcribing Six Languages via DiffusionGemma’s Parallel Denoising Decoder

インターフェイズが、音声を一度に文字にする新しいAIを公開。6言語に対応し、少ない学習で多言語化を実現した初のオープンソースモデルとして注目されます。
YCの若いスタートアップであるInterfazeが、新しい音声認識モデルをオープンソース化した。そのモデルはdiffusion-gemma-asr-smallと呼ばれる。このモデルは、自己回帰型ではなく、拡散デコーダーを介して音声を文字起こしする。これは初の多言語対応オーディオ拡散ASRモデルとされている。1つのアダプターで6つの言語を処理する。研究チームは、固定された26Bの基盤モデルの上に約42Mのパラメーターのみを学習させた。これはモデルの重みの約0.16%に相当する。ここで、2つの用語が重要になる。自己回帰モデルは、テキストを一度に1つのトークンずつ生成する。拡散モデルは、すべてのトークンを並行して洗練させる。このモデルは、音声からテキストへの変換に拡散アプローチを使用している。TL;DR Interfazeチームは、初のオープンソース多言語拡散ASRであると主張している。単一の約42Mパラメーターのアダプターで6つの言語に対応する。吸収型<mask>スキームではなく、DiffusionGemmaの拡散デコーダーと均一なランダムトークン拡散を使用して文字起こしを行う。文字起こしコストは、文字起こし長ではなく、ノイズ除去ステップ数に比例する。LibriSpeechでは拡散モデルの競合(Whisfusionの8.3%に対し6.6% WER)をリードするが、自己回帰型のWhisperには及ばない。アダプターはApache-2.0ライセンスで提供され、DiffusionGemma(Gemma terms)とwhisper-small(MIT)は個別にロードされる。diffusion-gemma-asr-smallとは何か?diffusion-gemma-asr-smallは、オーディオネイティブなASRモデルである。これは、離散拡散デコーダーを使用して音声をテキストに変換する。このデコーダーは、Googleの26B mixture-of-expertsモデルであるDiffusionGemmaに属している。DiffusionGemmaは、トップ8ルーティングで128のエキスパートを使用し、4Bのパラメーターをアクティブ化する。これは、自己回帰ではなく離散拡散によってテキストを生成する。拡散の詳細は特殊である。ほとんどの拡散LLMは吸収型<mask>スキームを使用する。DiffusionGemmaは代わりに、均一なランダムトークン拡散を使用する。これは、固定長のキャンバスをランダムな語彙トークンで埋める。各ステップで、確信度の高い予測を保持し、残りを再ランダム化する。数ステップ後、ノイズはテキストに変化する。Interfazeは、このテキスト専用モデルにオーディオを追加した。そのままの状態では、DiffusionGemmaは
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。