グラディウムが新しい音声翻訳AIを発表
Gradium Launches stt-translate and s2s-translate, Real-Time Speech Translation Models Beating gpt-realtime-translate on Accuracy and Latency

Gradiumが、話した言葉をリアルタイムで翻訳するAIを2つ発表。競合AIより正確で速く、音声クローン機能も搭載し、国際的な会話をスムーズにします。
Gradiumは本日、2つのリアルタイム音声翻訳モデル、stt-translateとs2s-translateをリリースしました。両モデルは5つの言語に対応し、ブラウザで結果をライブストリーミングします。Gradiumは、gpt-realtime-translateやgemini-3.5-live-translateよりも優れた精度と遅延のバランスを実現したと主張しています。また、gpt-realtime-translateにはない、クローンを含む出力音声制御機能も追加されています。TL;DR Gradiumは、2つのリアルタイム音声翻訳モデル、stt-translate(speech → text)とs2s-translate(speech → speech)を発表しました。これらは5つの言語(EN、FR、DE、ES、PT)と20のペアをカバーし、通常の3モデルのカスケードを2つに集約しています。精度はBLEUとMetricXでgemini-3.5-live-translateを上回り、BLEUではgpt-realtime-translateを凌駕しています(MetricXでは同等)。遅延は平均3.0秒で、gpt-realtime-translate(3.6秒)より速く、gemini-3.5-live-translate(2.9秒)にわずかに劣ります。gpt-realtime-translateとは異なり、出力音声を選択したり、自分の声をクローンしたりすることができ、これらすべてが1つの二重WebSocketを介して行われます。stt-translateは、ある言語の音声を受け取り、別の言語のテキストを返します。英語(EN)、フランス語(FR)、ドイツ語(DE)、スペイン語(ES)、ポルトガル語(PT)をサポートしています。このセット内の任意のソース言語から任意のターゲット言語へ対応しており、合計20の言語ペアをあらゆる方向でカバーします。重要な設計上の選択は、2つのステップを1つに集約したことです。文字起こしと翻訳は、音声モデル内で単一のパスで実行されます。中間的な文字起こしを待つ必要がなく、システム間のハンドオフもありません。Gradiumによると、このアプローチはHibiki-Zeroフレームワークに基づいています。モデルは強化学習を通じて、低遅延と高精度を同時に最適化します。これは、パイプライン内の可動部品が少ないことを意味します。s2s-translateは、ある言語の音声オーディオを別の言語の音声オーディオに、エンドツーエンドで変換します。これはstt-translateを基盤とし、GradiumのTTSモデルと組み合わせて1つのサービスとして提供されます。WebSocketを介してオーディオをストリーミングすると、生成された合成出力オーディオと翻訳された文字起こしの両方を受け取ることができます。これにより、中間的な
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。