OpenAI、素早い会話AI向け新モデル登場
OpenAI Releases GPT-Realtime-2.1 and GPT-Realtime-2.1-mini for Low-Latency Voice Agents in the API

OpenAIが会話AI向けの新モデルを発表。AIが考える機能と処理の改善で、応答時間が25%以上短縮され、よりスムーズな会話が可能になるため重要です。
OpenAIは、APIで2つの新しいRealtimeモデルをリリースしました。それらはgpt-realtime-2.1とgpt-realtime-2.1-miniと名付けられています。両モデルとも、低遅延の音声およびマルチモーダル体験を対象としています。このリリースで注目すべきはminiモデルです。これはリアルタイム音声向けのmini reasoning modelです。以前のgpt-realtime-miniと同じコストで提供されます。OpenAIはまた、Realtime音声モデル全体でp95 latencyを少なくとも25%削減しました。この削減は、キャッシュの改善によるものです。gpt-realtime-2.1-miniとは何かgpt-realtime-2.1-miniは、リアルタイム音声対話向けのmini reasoning modelです。ライブ接続を介して音声およびテキスト入力に応答します。OpenAIはこれを、ラインナップの中でより高速でコスト効率の高いオプションとして位置付けています。Realtime APIは、単一のモデルで音声を処理および生成します。これにより、個別のspeech-to-textシステムとtext-to-speechシステムを連結する必要がなくなります。この単一モデル設計により、latencyが削減され、音声のニュアンスが保持されます。ここで主要な機能はReasoningです。これは、モデルが話す前に内部的に考えることができることを意味します。mini層は、Realtime APIを介したtool use、つまりfunction callingもサポートしています。これらを組み合わせることで、miniモデルはステップを計画し、あなたの関数を呼び出し、それから応答することができます。より大きな兄弟モデルはgpt-realtime-2.1です。これはGPT-Realtime-2をアップデートし、英数字認識を改善しています。また、沈黙やノイズの処理、割り込み時の動作も改善されています。設定可能なreasoning effort、instruction following、tool useによるspeech-to-speechをサポートしています。両モデルの簡単な選び方:最も強力なリアルタイムreasoning、tool use、instruction following、およびvoice-agentの動作が必要な場合はgpt-realtime-2.1を使用してください。より高速でコスト効率の高いオプションが必要な場合はgpt-realtime-2.1-miniを使用してください。なぜReasoningとTool Useがここで重要なのか音声エージェントは、tool calls中にしばしば停止します。モデルが関数呼び出しを実行すると、沈黙します。ユーザーは通話が切れたと思い、割り込みます。これにより、部分的な結果と混乱した会話状態が生まれます。Reasoningと口頭での前置きがこのパターンを修正します。
この記事について質問
記事の内容に答えます。記事外のことは都度ウェブで調べます。