日本語

製品発表OpenAI

OpenAI、低レイテンシ音声AI実現のためWebRTCスタックを再設計

OpenAIの技術スタッフチームは、リアルタイムAIインタラクションを担当する部門として、WebRTCスタックの再設計を行ったと発表した。これにより、OpenAIのインフラストラクチャに適合しない既存の制約を解消している。

従来の方式では、セッションごとにポートを割り当てるメディア終了処理や、状態を持つICE・DTLSセッションの安定した所有権管理が課題だった。さらに、グローバルルーティングにおける初回ホップのレイテンシを低く保つことも必要だった。

新アーキテクチャは、クライアントに対して標準的なWebRTC動作を維持しつつ、OpenAI内部でのパケットルーティング方法を変更する「分割リレートランスシーバ」方式を採用している。

WebRTCは、NATトラバーサルや暗号化トランスポート、コーデックネゴシエーションなど、インタラクティブメディアの難所を標準化している。OpenAIは、ブラウザやモバイルプラットフォームで実装済みのこのプロトコルスタックを基盤とし、リアルタイムメディアとモデルを接続するインフラ構築に注力している。

AI応用において重要なのは、音声が続流として到着することである。これにより、ユーザーが話している最中に文字起こしや推論、ツール呼び出しが可能になる。この仕組みは、プッシュトゥトーク方式との決定的な違いを形成している。

OpenAIは、WebRTCエコシステムやオープンソース実装の上に構築している。WebRTCの元アーキテクトであるJustin Uberti氏や、Pionの開発者であるSean DuBois氏がOpenAIに在籍しており、メディアインフラの活用を支援している。


出典: How OpenAI delivers low-latency voice AI at scale(HN 510pt・146コメント)(HN Search (backfill)、2026-05-05)