OpenAI / ChatGPT / Codex のロゴ

OpenAI / ChatGPT / Codex / リリースノート / 2026/07/06 / 重要

Realtime API に新しい音声推論モデルが追加

AIapi

公式リリースノート

OpenAI API changelog では、Realtime API 向けに gpt-realtime-2.1gpt-realtime-2.1-mini が追加されました。音声アプリケーション向けに、認識、無音・ノイズ処理、割り込み挙動の改善が示されています。

要点

  • gpt-realtime-2.1 は、Realtime API 向けの更新されたリアルタイム推論モデルとして追加されました。
  • alphanumeric recognition、silence and noise handling、interruption behavior の改善が説明されています。
  • gpt-realtime-2.1-mini は、より高速で低コストな蒸留推論モデルとして、リアルタイム音声アプリケーション向けに追加されています。

今回のリリースノートで語られていること

今回の OpenAI API changelog は、Realtime API における音声対話モデルの更新です。gpt-realtime-2.1 は、リアルタイム音声アプリケーション向けの推論モデルとして追加され、英数字認識、無音やノイズの扱い、ユーザーの割り込みへの応答が改善されたと説明されています。音声エージェントでは、ユーザーが途中で話し始める、背景音が入る、英数字やコード、注文番号、顧客番号を読み上げる、といった場面が多くあります。これらの精度や挙動が改善されると、会話が途切れにくくなり、実務アプリケーションに組み込みやすくなります。

同時に gpt-realtime-2.1-mini も追加されています。これは、より高速で低コストな蒸留推論モデルと説明されており、大量の音声セッション、コールセンター補助、会議支援、対話型ヘルプ、端末組み込みのような用途で選択肢になります。すべての音声対話で最上位モデルが必要とは限らないため、品質、応答速度、コストのバランスを取れる mini 系モデルの存在は重要です。特にリアルタイム音声では、わずかな遅延やコスト差がユーザー体験と運用費に影響します。

導入側は、既存の Realtime API 実装をそのまま切り替えるのではなく、実際の音声データで評価する必要があります。英数字の読み上げ、騒がしい環境、長い無音、途中割り込み、複数話者、電話品質の音声、業界特有の用語を含むテストを用意したいです。また、mini を使う場合は、低コスト化でどの程度の品質差が出るか、重要な業務では fallback や人への引き継ぎをどう置くかを確認する必要があります。今回の更新は、音声エージェントを本番業務へ入れるチームにとって、モデル選択と評価セットを見直すきっかけになります。

今回のリリースノートが関係する人

Realtime API で音声エージェントや会話UIを作る開発者、コールセンターや音声アシスタントを運用するプロダクトチーム、音声品質とコストを管理するAI基盤チームに関係します。

実務で確認したいポイント

  • 英数字、固有名詞、ノイズ、無音、割り込みを含む実音声評価セットを作る。
  • gpt-realtime-2.1gpt-realtime-2.1-mini の遅延、品質、コストを比較する。
  • 重要業務では、誤認識時の確認、再質問、人への引き継ぎを設計する。

結局、今回のリリースノートをどう読むべきか

GPT-Realtime 2.1 は、音声AIの実運用で問題になりやすい認識と会話制御を改善する更新です。導入時は、実際の音声条件で mini との使い分けを検証したいです。