Google、70言語対応の音声翻訳AIを発表
Google Releases Gemini 3.5 Live Translate, a Streaming Speech-to-Speech Audio Model Covering 70+ Languages Across Meet, Translate, and the Live API

Googleが70以上の言語に対応し、話し手の声の調子を保ちながらリアルタイムで翻訳する新しいAIを発表。これにより、国際的なコミュニケーションが格段にスムーズになります。
GoogleはGemini 3.5 Live Translateを発表しました。これは、ライブの音声間翻訳のための最新のオーディオモデルです。音声間翻訳とは、話された音声が入力され、翻訳された話された音声が出力されることを意味します。このモデルは70以上の言語を自動的に検出し、翻訳された音声を生成します。出力では、話し手のイントネーション、ペース、ピッチを保持します。従来のターンバイターンシステムは、話し手が話し終えるのを待ってから応答します。Gemini 3.5 Live Translateは、代わりに音声を継続的に生成します。これは、文脈を待つことと即座に翻訳することのトレードオフのバランスを取ります。より多くの文脈は品質を向上させます。より速い出力は、翻訳を話し手と同期させます。結果として、セッション全体を通して話し手から数秒遅れることになります。Gemini 3.5 Live Translateは、チャットアシスタントではなく、単一のオーディオモデル(gemini-3.5-live-translate-preview)です。これは、完全な文の後ではなく、オーディオがストリーミングされると同時に音声を処理します。手動で設定を構成することなく、多言語入力を処理します。そのノイズ耐性により、アプリケーションは騒がしく予測不可能な環境でも実行できます。このモデルは3つのプラットフォームで展開されます。開発者はGemini Live APIとGoogle AI Studioを通じてパブリックプレビューで利用できます。企業向けには、今月からGoogle Meetでプライベートプレビューが提供されます。その他のユーザーは、AndroidおよびiOSのGoogle Translateアプリを通じて利用できます。連続ストリーミングの仕組みこの設計の違いは、リアルタイム機能を構築する上で重要です。会話型Liveエージェントはターンベースのインタラクションを使用します。それは一時停止、意図検出、および中断処理に依存します。Live Translationは代わりに連続ストリーム処理を使用します。話し手が話している間、ターンが終了するのを待つことなく翻訳します。厳密なリアルタイム遅延しきい値を維持するために、翻訳パスは音声入力のみを受け入れます。翻訳モードではテキスト入力はサポートされていません。このモードでは、モデルはツール使用とシステム指示も削除します。これにより、翻訳に特化したパイプラインとして機能します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。