OpenAIは、持続的なエージェントのパフォーマンスとコスト効率を向上させるために設計された、改良されたプロンプトキャッシュシステムを導入しました。コードベースのリファクタリングや、調査に基づくドキュメント作成といった複雑なタスクを実行するこれらのエージェントは、複数のAPIリクエストにわたって膨大なコンテキストを再利用することがよくあります。この共有コンテキストをキャッシュすることで、OpenAIはレスポンス時間を短縮し、キャッシュされた入力トークンに対して最大 90% の割引を開発者に提供します。
GPT-6ファミリー向けの新しいシステムは、デフォルトでより高いキャッシュヒット率を実現し、開発者向けのいくつかのツールを導入しています。新しい「プロンプトキャッシュ・ダッシュボード」を使用すると、ユーザーはキャッシュのパフォーマンスを監視し、時間の経過に伴うヒット率を追跡し、入力構成チャートを使用してキャッシュされたトークンとキャッシュされていないトークンを比較できます。さらに、プロンプトキャッシュ診断ツールにより、開発者は予期しないキャッシュミス(cache miss)の原因を把握できます。
統合を最適化するために、開発者は明示的なキャッシュ・ブレークポイントを使用し、どのプロンプト・プレフィックスを再利用するかを正確に選択できるようになりました。GPT-6モデルでは、既存のキャッシュを維持したまま、configuration_updateを使用してレスポンス間の推論強度(reasoning effort)を調整することも可能になり、より柔軟なタスク管理が実現します。さらに、既知のコンテキストを事前に準備して最初のレスポンスのレイテンシを削減する「プリウォーミング(prewarming)」特集も利用可能です。
出典
- Better prompt caching for GPT-6 (OpenAI News, 2026-09-22)
- prompt caching guide