OpenAIは7月8日、ChatGPTの音声会話体験をより自然にする新世代の音声モデル「GPT-Live」を発表しました。GPT-Liveは、AIとの会話をより実際の会話に近づけることを目的としたモデルで、ChatGPTの音声機能に順次導入されます。
従来の音声AIでは、ユーザーが話し終えるのを待ってから応答する「ターン制」のやり取りになりがちでした。GPT-Liveではこの仕組みを見直し、ユーザーの発話を聞きながら同時に話すことができる「フルデュプレックス」型のアーキテクチャを採用しています。
話しながら聞く、より自然な音声会話へ
OpenAIによると、GPT-Liveは会話中にユーザーの発話を継続的に処理しながら、応答や待機、割り込み、ツール利用などを判断します。これにより、ユーザーが途中で質問を挟んだり、考えるために少し間を置いたり、ChatGPTに「もう少しゆっくり話して」と頼んだりすることが、より自然に行えるようになります。
また、GPT-Liveは会話中に「mhmm」「yeah」「got it」といった短い相づちを返すこともできます。OpenAIは、こうした反応によってChatGPTが会話を聞いていることが伝わりやすくなり、音声でのやり取りがより滑らかになると説明しています。
高度な質問はGPT-5.5に委任
GPT-Liveはリアルタイムの音声会話を担う一方で、Web検索や深い推論、複雑な作業が必要な場合には、バックグラウンドでより高度なモデルに処理を委任します。
OpenAIの発表では、ローンチ時点でこのバックグラウンド処理にはGPT-5.5が使われるとされています。ユーザーとの会話を続けながら必要な処理を進め、結果がまとまった時点で会話に戻すことができる、という仕組みです。
この設計により、単に音声応答が自然になるだけでなく、音声会話の中でより複雑な依頼にも対応しやすくなると見られます。
ライブ翻訳やビジュアルカードにも対応
GPT-Liveは、ライブ翻訳にも対応します。また、天気、株価、スポーツなどの話題では、音声だけでなく視覚的なカードを表示することもできます。
さらにOpenAIは、ChatGPTで利用できる9種類の音声をGPT-Live向けにリマスターしたと説明しています。これにより、既存のChatGPT Voice体験も今後置き換えられていく見込みです。
有料ユーザーと無料ユーザーで異なるモデルを提供
OpenAIは、GPT-Liveを世界中のChatGPTユーザーに向けて順次展開します。提供されるモデルは2種類です。
- GPT-Live-1:Go、Plus、Proユーザー向けの標準モデル
- GPT-Live-1 mini:無料ユーザー向けの標準モデル
利用するには、ChatGPT内の「Voice」ボタンをタップします。
なお、現時点ではChatGPT内での音声とビデオ、または画面共有を組み合わせた利用にはまだ対応していません。OpenAIは、この機能についても今後追加する予定だとしています。
音声AIの使い勝手を大きく変える可能性
GPT-Liveは、ChatGPTの音声体験を単なる音声入力・音声出力から、より会話的なインターフェースへ進化させる試みです。
特に、途中で割り込めること、考える時間を自然に扱えること、必要に応じて高度なモデルに処理を任せられることは、音声AIを日常的に使う上で大きな違いになりそうです。
一方で、ビデオや画面共有との連携はまだ今後の対応となっており、実際の使い勝手は各ユーザーへの展開後に確認していく必要があります。
