OpenAI、同時会話の新音声AI
OpenAI Releases GPT-Live and GPT-Live-1 mini: Full-Duplex Voice Models That Delegate Deeper Reasoning to GPT-5.5

OpenAIが同時に話せる新音声AI「GPT-Live」を発表。会話がより自然になり、リアルタイムでAIと対話できるため重要です。
本日、OpenAIはGPT-Liveをリリースしました。これは新世代の音声モデルです。GPT-Liveは現在、ChatGPTの音声体験を支えています。その目標は、AIとの自然でリアルタイムな会話です。まず2つのバージョン、GPT-Live-1とGPT-Live-1 miniが提供されます。両方とも本日、世界中のChatGPTユーザーに展開されます。TL;DR GPT-Liveは同時に聞き取りと発話ができるfull-duplex音声モデルファミリーです。会話を継続させながら、検索や推論はGPT-5.5に委任します。人間によるテストでは、GPT-Live-1とminiはAdvanced Voice Modeよりも強く好まれました。本日、世界中のChatGPTユーザーに提供され、APIは近日中に予定されています。リリース時点では、ビデオ、画面共有、完全な多言語対応は利用できません。GPT-Liveとは?GPT-Liveはfull-duplex architectureに基づいて構築されています。full-duplexとは、モデルが同時に聞き取りと発話ができることを意味します。会話中、モデルは「うーん」や「うん」のような短い合図を加えることができます。素早いやり取りに参加したり、ユーザーが考えている間は静かにしたりできます。ウェブ検索、より深い推論、または複雑な作業が必要な質問の場合、GPT-Liveは委任します。舞台裏で、そのタスクをfrontier modelに渡します。準備が整うと、結果は会話に戻されます。リリース時点では、そのバックグラウンドモデルはGPT-5.5です。frontier modelが作業している間も、GPT-Liveは会話を継続させます。なぜCascadedおよびTurn-Based Voiceは不十分だったのか
以前の音声システムは自然な会話へと進化しましたが、トレードオフがありました。Cascaded voice systemsは、ターンごとに3つの異なるモデルを連鎖させました。まず、speech-to-textモデルがユーザーの音声を文字に起こしました。次に、large language modelが応答を生成しました。そして、text-to-speechモデルがそのテキストを音声に変換し直しました。これにより、人々は初めてfrontier modelと話すことができました。しかし、モデル間で情報が失われる可能性があり、応答は遅く不自然でした。ChatGPT Advanced Voice ModeのようなTurn-based voice modelsは、1つのモデル内で音声を処理しました。これにより、遅延が減少し、会話がよりスムーズになりました。それでも、彼らは個別のターンで動作し、待機していました
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。