OpenAIは数日前に技術ブログを公開しました。これに対し、WebRTCのSFUを開発した経験を持つ著者が、WebRTCはボイスAIの利用には適していないと主張しています。[The Verge]
WebRTCは会議向けに設計されており、ネットワーク状態が悪い場合に遅延を抑えるため音声を積極的に捨てます。しかし、LLMへのプロンプトとして送る音声は、200ms程度待ってでも正確さを確保すべきだと著者は指摘します。再送が難しいため、劣化したプロンプトは低品質な回答を生む原因になるとしています。
また、生成された音声のストリーミングにも問題があると述べています。WebRTCにはバッファがなく、到着時刻に基づいて再生されるため、OpenAIは送信前に人工的な遅延(sleep)を追加してタイミングを調整せざるを得ない状況です。[The Verge]
この方式は、ネットワーク混雑時にパケットが失われ再送されないリスクを伴います。著者は、これにより「低レイテンシを保つ」というWebRTCの目的と矛盾する結果が生じていると分析しています。[The Verge]
出典: OpenAI’s WebRTC problem(HN 511pt・149コメント)(HN Search (backfill)、2026-05-08)