OpenAIは2026年9月10日、フルデュプレックス音声モデルGPT-Live-1をAPIで一般提供しました。フルデュプレックスとは、人とAIが同時に話し、AIが発話中も聞き続けられる方式です。

従来の「音声認識 → テキストLLM → 音声合成」という直列構成に比べ、割り込み、相づち、考え中の沈黙を一つの音声モデルが扱います。複雑な調査やツール操作は別のバックエンドモデルへ委譲できるため、会話を止めずに仕事を進める設計が可能です。

公開データでは応答遅延0.798秒、会話ダイナミクス評価97.3%、音声フロント層は1分0.05ドル。電話受付や予約、音声サポートを作るチームにとって、アーキテクチャの選択肢が大きく変わります。

VOICE API / SEP 2026

「話し終わるまで待つ」音声AIからの転換

0.798秒応答開始レイテンシ
97.3%会話ダイナミクス
約80%減思考中の誤割り込み
$0.05/分音声フロント層

OpenAI公式発表・Artificial Analysis掲載値。顧客事例と評価条件は本文で区別しています。

背景:直列型の音声AIは会話のタイミングを失いやすい

一般的な音声エージェントは、音声認識(STT)、LLM、音声合成(TTS)を順につなぎます。各段階の待ち時間が加算され、利用者が言い直したときは、再生停止、文字起こしの確定、処理中ツールの中断をアプリ側で調整します。

GPT-Live-1は入力音声と出力音声を同じモデルで継続的に扱い、話す、聞く、待つ、中断する、相づちを打つという判断を何度も行います。OpenAIは、従来構成にあった脆い引き継ぎを減らせると説明しています。

従来のカスケード型

音声 → STT → LLM → TTS → 音声

各境界で遅延、文脈欠落、割り込み制御が発生
GPT-Live-1

音声 ⇄ フルデュプレックス音声層 ⇄ バックエンド

会話を継続しながら推論やツール処理を委譲

何が新しいのか

聞きながら話し、自然に割り込まれる

利用者がAIの発話中に質問を変えたり、短い相づちを入れたりしても、会話の流れとして扱います。背景音、沈黙、別の人への発話も区別しやすくなったとOpenAIは説明しています。

会話と深い処理を分離する

GPT-Live-1は音声対話を担当し、検索、推論、ツール実行をGPT-6 Astraなどのテキストモデルや外部エージェントへ委譲できます。音声層を速い対話に集中させ、バックエンドは必要な知能・費用に合わせて選べます。

電話・ブラウザ・サーバーへ接続できる

公式案内ではWebRTC、WebSocket、電話網に対応します。文字起こしと応答テキスト、キーワードバイアス、ターン検出も提供されます。

公開評価を読み解く

指標GPT-Live-1比較・意味注意
Full Duplex Bench80.1%GPT-Realtime-2.1より30ポイント向上OpenAI評価
会話ダイナミクス97.3%発話順、沈黙、割り込み、相づちArtificial Analysisは現時点で2位
応答開始0.798秒GPT-Realtime-2.1は1.41秒条件依存
ツール呼び出し87%ためらい・言い直しを含む音声要求バックエンドTerra low
回答品質90%参照意図との一致同上

Artificial Analysisでは、会話ダイナミクスはQwen Audio 3.0 Realtime Plusの98.4%がGPT-Live-1の97.3%を上回ります。一方、同サイトの初回音声時間ではAstra medium構成が0.27秒で最速とされています。単一指標で「最高」と断定せず、自然さ、速度、費用、ツール成功率を分けて評価すべきです。

OpenAI顧客のSpeakは、学習者が考えている途中の割り込みを従来のターン型より約80%減らしたと報告しました。別の顧客事例では、直列構成からの移行でコードベースを80%、2.3万行削減したとされています。いずれも顧客固有の初期評価であり、一般的な保証値ではありません。

費用の考え方

音声フロント層は1分0.05ドルで秒単位課金です。10分の電話なら0.50ドル、1,000件なら500ドルが音声層の単純計算になります。

ただし、バックエンドモデル、検索、ツール、電話回線、ログ保存は別料金です。実務では次の式で1通話当たり費用を追います。

総費用 = 音声時間 × $0.05/分 + バックエンド推論 + ツール + 通信・保存

会話中ずっと高性能モデルを使わず、予約変更は小型モデル、複雑な苦情は高推論モデルへ振り分ける設計が費用を左右します。

実務で向く用途

  • 電話受付・予約:日時、人数、氏名を自然な言い直し込みで聞き取る。
  • カスタマーサポート:本人確認や検索中も対話を維持し、必要なら人へ転送する。
  • 語学学習:考える沈黙を待ち、相づちと訂正のタイミングを調整する。
  • ハンズフリー業務:現場作業者が画面を触らず、指示確認や記録を行う。
  • 音声での開発支援:リポジトリ調査をCodexへ委譲し、短い音声回答を返す。

本番導入の設計ポイント

会話状態

発話中、委譲中、承認待ち、転送中を明示。

中断の意味

音声停止とバックエンド処理取消を分離。

確認読み上げ

金額・日時・送信先は実行前に復唱。

人への転送

低信頼、怒り、緊急性、規制対象を検知。

特に重要なのは、利用者がAIへ割り込んでも、バックエンドの予約処理や送信処理が自動でキャンセルされるとは限らない点です。音声再生の停止、委譲タスクの取消、外部操作のロールバックを別々に設計します。

リスクと限界

  1. 誤認識と誤操作:氏名、数字、固有名詞は画面表示や復唱で確認する。
  2. 録音・プライバシー:録音通知、保存期間、アクセス権、地域要件を明示する。
  3. なりすまし:声だけを本人確認に使わず、多要素認証を組み合わせる。
  4. バックグラウンド音声:テレビや第三者の発話を命令として扱わない評価が必要。
  5. 言語差:OpenAI自身も、一部言語で非母語的なアクセントや流暢さの差があると説明している。
  6. 評価の偏り:電話回線品質、方言、高齢者、騒音環境を自社データで試験する。

今後注目すべき点

日本語での割り込み、敬語、長い沈黙、電話回線の8kHz音声における第三者評価が必要です。カスタム音声は営業窓口への申請が必要で、利用資格や本人同意の運用も確認すべきでしょう。

また、2026年7月以降、対応するGPT-Live音声にはSynthID透かしが付与され、検証APIも提供されています。企業利用では、生成音声の出所表示と監査ログをセットで設計する動きが強まりそうです。

参照元

最終確認日:2026年9月14日

Previous Post Next Post