OpenAIは、開発者が音声対応アプリやビジネスワークフローを構築するための強力な音声モデルとして、GPT-Live-1をAPIで提供開始しましたと発表しました。ChatGPTで導入された機能をAPI向けに展開したもので、音声の聞き取りと発話を同時に行うことが可能です。
OpenAI、API向けに音声モデル「GPT-Live-1」を提供開始
従来の音声エージェントは、音声認識、推論、音声合成の各プロセスを順次つなぎ合わせていましたが、GPT-Live-1はこれらを単一のモデルで処理します。これにより、会話のリズムや文脈の維持が容易になります。また、ユーザーによる発話の割り込みや、相槌(バックチャネル)に対しても、リアルタイムで応答できる設計となっています。
開発者は、用途に応じてバックエンドの推論モデルを自由に組み合わせることができます。例えば、スケジューリングなどの定型的なタスクには軽量なモデルを、複雑な顧客対応には高度な推論を行うモデルをペアリングすることが可能です。なお、利用料金はフロントエンドの音声レイヤーとして1分あたり0.05ドルとされています。
出典
- Build more natural voice experiences with GPT‑Live‑1 in the API (OpenAI News、2026-09-10)