OpenAI / ChatGPT / Codex / リリースノート / 2026/07/06 / 重要
Realtime API に新しい音声推論モデルが追加
公式リリースノート
OpenAI API changelog では、Realtime API 向けに gpt-realtime-2.1 と gpt-realtime-2.1-mini が追加されました。音声アプリケーション向けに、認識、無音・ノイズ処理、割り込み挙動の改善が示されています。
要点
gpt-realtime-2.1は、Realtime API 向けの更新されたリアルタイム推論モデルとして追加されました。- alphanumeric recognition、silence and noise handling、interruption behavior の改善が説明されています。
gpt-realtime-2.1-miniは、より高速で低コストな蒸留推論モデルとして、リアルタイム音声アプリケーション向けに追加されています。
今回のリリースノートで語られていること
今回の OpenAI API changelog は、Realtime API における音声対話モデルの更新です。gpt-realtime-2.1 は、リアルタイム音声アプリケーション向けの推論モデルとして追加され、英数字認識、無音やノイズの扱い、ユーザーの割り込みへの応答が改善されたと説明されています。音声エージェントでは、ユーザーが途中で話し始める、背景音が入る、英数字やコード、注文番号、顧客番号を読み上げる、といった場面が多くあります。これらの精度や挙動が改善されると、会話が途切れにくくなり、実務アプリケーションに組み込みやすくなります。
同時に gpt-realtime-2.1-mini も追加されています。これは、より高速で低コストな蒸留推論モデルと説明されており、大量の音声セッション、コールセンター補助、会議支援、対話型ヘルプ、端末組み込みのような用途で選択肢になります。すべての音声対話で最上位モデルが必要とは限らないため、品質、応答速度、コストのバランスを取れる mini 系モデルの存在は重要です。特にリアルタイム音声では、わずかな遅延やコスト差がユーザー体験と運用費に影響します。
導入側は、既存の Realtime API 実装をそのまま切り替えるのではなく、実際の音声データで評価する必要があります。英数字の読み上げ、騒がしい環境、長い無音、途中割り込み、複数話者、電話品質の音声、業界特有の用語を含むテストを用意したいです。また、mini を使う場合は、低コスト化でどの程度の品質差が出るか、重要な業務では fallback や人への引き継ぎをどう置くかを確認する必要があります。今回の更新は、音声エージェントを本番業務へ入れるチームにとって、モデル選択と評価セットを見直すきっかけになります。
今回のリリースノートが関係する人
Realtime API で音声エージェントや会話UIを作る開発者、コールセンターや音声アシスタントを運用するプロダクトチーム、音声品質とコストを管理するAI基盤チームに関係します。
実務で確認したいポイント
- 英数字、固有名詞、ノイズ、無音、割り込みを含む実音声評価セットを作る。
gpt-realtime-2.1とgpt-realtime-2.1-miniの遅延、品質、コストを比較する。- 重要業務では、誤認識時の確認、再質問、人への引き継ぎを設計する。
結局、今回のリリースノートをどう読むべきか
GPT-Realtime 2.1 は、音声AIの実運用で問題になりやすい認識と会話制御を改善する更新です。導入時は、実際の音声条件で mini との使い分けを検証したいです。