OpenAIは2026年5月7日(現地時間)、Realtime APIに音声関連の新モデル「GPT-Realtime-2」「GPT-Realtime-Translate」「GPT-Realtime-Whisper」を追加すると発表しました。
音声での自然な対話を担うモデルに加え、リアルタイム翻訳とストリーミング文字起こしをそれぞれ専門とするモデルがそろい、音声を使ったサービスの構築を支援します。
GPT-Realtime-2は音声対話中の推論と制御を強化
新モデルの中心となる「GPT-Realtime-2」は、音声を入力して音声で応答するspeech-to-speech型のモデルで、OpenAIによると、音声対話モデルとして初めてGPT-5クラスの推論機能を備えています。
ユーザーの発話を受け取って応答するだけでなく、会話の途中で推論しながらリクエストを処理し、前後のやり取りを踏まえて自然に会話を続けられることが特徴です。
コンテキストウィンドウは128Kに拡大
コンテキストウィンドウは前世代の32Kから128Kへ拡大しました。
より多くの会話内容や指示を扱えるため、複数の条件を含む依頼や、長い対話の文脈を保つ必要がある用途での活用が期待されます。
また、外部ツールを並列で呼び出す機能や、応答のトーンを調整する機能も備えています。
推論にかける労力は「minimal」から「xhigh」まで設定でき、応答の速さを優先する場面と、複雑な内容を慎重に処理したい場面とで調整できます。
こうした設定は、応答品質だけでなく、対話の速度や利用コストにも関係するため、サービスの目的に応じた設計が重要です。
翻訳と文字起こしに特化した2モデル
| モデル | 主な機能 | 料金 |
|---|---|---|
| GPT-Realtime-2 | 音声によるリアルタイム対話 | 音声トークン100万個あたり入力32米ドル、キャッシュ入力0.40米ドル、出力64米ドル |
| GPT-Realtime-Translate | リアルタイム音声翻訳 | 1分あたり0.034米ドル |
| GPT-Realtime-Whisper | ストリーミング音声文字起こし | 1分あたり0.017米ドル |
70以上の入力言語に対応する音声翻訳
「GPT-Realtime-Translate」は、70以上の言語による音声入力を受け付け、13の言語へリアルタイムに翻訳するモデルです。
音声を別の言語に変換しながら届ける用途を想定しており、多言語での案内や会話を支援するアプリケーションなどに利用できます。
発話と並行して文字起こし
「GPT-Realtime-Whisper」は、話している音声をリアルタイムでテキスト化するspeech-to-textモデルです。
発話が終わるまで待たずに文字起こしを進められるため、ライブ字幕や会議の議事録作成、授業内容の記録などに活用できます。
音声対話、翻訳、文字起こしを用途別のモデルとして提供することで、開発者は必要な処理を選びやすくなります。
ベンチマークで推論・指示追従の改善
OpenAIが示した評価結果では、音声入力に対応するモデルの推論能力を測る「Big Bench Audio」において、GPT-Realtime-2(high)はGPT-Realtime-1.5を15.2%上回りました。
音声対話システムの複数ターンにわたる能力を評価する「Audio MultiChallenge」では、GPT-Realtime-2(xhigh)が指示追従で13.8%高い評価を得ています。
これらの結果は、音声を聞き取るだけでなく、会話の文脈を管理し、指示に沿って応答を制御する能力の向上を示すものです。
ただし、ベンチマークのスコアは特定の評価条件での結果であり、実際の性能は音声の品質や会話内容、アプリケーションの設計などによって変わります。
料金を踏まえたモデル選びが重要
GPT-Realtime-2の料金は音声トークン数に基づき、入力は100万トークンあたり32米ドル、キャッシュされた入力は0.40米ドル、出力は64米ドルです。
翻訳モデルと文字起こしモデルは利用時間に応じた料金で、GPT-Realtime-Translateが1分あたり0.034米ドル、GPT-Realtime-Whisperが同0.017米ドルです。
課金単位が異なるため、モデル間の価格を単純に比較するのではなく、音声の長さ、入出力の量、必要な機能をもとに利用コストを見積もる必要があります。
まとめ
GPT-Realtime-2は、GPT-5クラスの推論機能や128Kのコンテキストウィンドウを備え、音声対話における文脈理解と制御の強化を目指したモデルです。
翻訳のGPT-Realtime-Translate、文字起こしのGPT-Realtime-Whisperも加わり、リアルタイム音声処理の用途に応じてモデルを選べるようになりました。
導入を検討する際は、ベンチマークだけでなく、求める応答速度や対応言語、料金体系を確認し、実際の利用環境で評価することが大切です。
