SpaceXAIは、実環境における高精度化とコスト効率を目的として設計された最新の音声文字起こしモデル、Grok Voice Transcribe 2.0 をリリースしました。同社によると、この新モデルは、従来の価格体系を維持したまま、Grok Voice Transcribe 1.0 の2倍の精度を実現しているとのことです。
モデル発表SpaceX AIGrok Voice Transcribe 2.0
SpaceXAI、精度の向上と多言語対応を実現した Grok Voice Transcribe 2.0 をリリース
この記事は翻訳です。 原文を読む
このモデルは、すでにカスタマーサポートの電話やTeslaの車両で使用されている Grok Voice を支えるオーディオ 基盤モデル をベースに構築されています。Grok Voice Transcribe 2.0 は、騒音環境、複数人の話者、多様なアクセントといった困難な音声条件下で最適化されています。Artificial Analysis のリーダーボードにおいて、同モデルは現在、32 ストリーミングモデルの中で精度において第1位にランクされています。
Grok Voice Transcribe 2.0 は、多言語における精度の著しい向上を特徴としており、数十の言語をサポートし、文字起こし中に言語を自動検出します。また、録音の途中で言語が切り替わった場合でも、シングルパスでの対応が可能です。
同モデルは、リアルタイムストリーミング用の REST API および WebSocket を通じて利用可能です。価格は、バッチ文字起こしが $0.10 per 時間あたり、ストリーミングが $0.20 per 時間あたりとなっており、従来版と同一です。SpaceXAIは、Grok Voice Transcribe 2.0 がまもなく同社の Speech-to-Text API のデフォルトとなり、1.0 バージョンは数週間以内に非推奨となる予定であると述べています。
出典
- Grok Voice Transcribe 2.0 (Hacker News Frontpage, 2026-09-18)
- Documentation