マイクロソフト、AI音声文字化を強化
Microsoft AI Introduces MAI-Transcribe-1.5: 2.4% WER on Artificial Analysis, Best-in-Class FLEURS Accuracy, and Up to 5x Faster Long-Audio Transcription

マイクロソフトが新しい音声認識AIを発表。43言語に対応し、長い音声の文字化が最大5倍速くなり、様々な業務で効率が大きく向上します。
先週、Microsoft AIはMAI-Transcribe-1.5を発表しました。これは同社が自社開発した音声テキスト変換ファミリーの第2世代です。このモデルは、43の言語、アクセント、騒がしい環境全体での精度を目標としています。Microsoftチームは、これを本番環境での文字起こし作業向けに位置付けています。 MAI-Transcribe-1.5とは MAI-Transcribe-1.5は、自動音声認識(ASR)モデルです。音声を入力として受け取り、テキストを返します。Microsoftはこれを自社で構築し、サードパーティの基盤は使用していません。このモデルは、単一システムで43言語を処理します。多様なアクセント、方言、現実世界の音響条件に最適化されています。MicrosoftはこれをCopilot、Teams、GitHub、およびDynamics 365 Contact Centreに統合しています。また、MicrosoftのモデルプラットフォームであるFoundryでも利用可能です。 精度について ここでの精度は、Word-Error-Rate(WER)で測定されます。WERが低いほど、文字起こしされた単語あたりの間違いが少ないことを意味します。Microsoftは、FLEURSにおいて43言語全体でクラス最高のWERを報告しています。FLEURSは、標準的な多言語文字起こしベンチマークです。Artificial Analysisのリーダーボードでは、このモデルは2.4%のWERを記録しています。これは、競争の激しいオープンベンチマークで3位に位置します。したがって、状況は分かれています。MicrosoftチームはFLEURSで1位、Artificial Analysisで3位と主張しています。言語の拡張は、もう一つの精度の話です。対応言語は25から43に増加しました。18の新しい言語は、精度を損なうことなく追加されました。そのうち10言語はベンガル語、タミル語、テルグ語を含む南アジアの言語です。8言語はウクライナ語、ギリシャ語、カタロニア語などのヨーロッパの言語です。 速度 MAI-Transcribe-1.5は、Artificial Analysisのリーダーボードで精度と速度の点でリードしています。同等の精度のモデルよりも最大5倍高速に動作します。この効果は、長いオーディオファイルで最も大きくなります。このモデルは、1時間の音声を15秒未満で文字起こしできます。Microsoftは、長いオーディオにおいてGemini 3.1、Scribe v2、およびGPT-4o-Transcribeと比較して最大5倍の高速化を挙げています。以前のMAI-Transcribe-1と比較して、Azureカードには最大5.7倍高速な長尺推論が記載されています。バッチ
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。