Gemini 3.5 Transcribeは、音声から直接、整形済みのテキストに変換するSpeech-to-Textモデルです。背景ノイズや専門用語、言い淀みなどの処理に特化しています。
モデル発表GoogleGemini 3.5 Transcribe
Googleが音声文字起こしモデルGemini 3.5 Transcribeを公開
モデルは2種類のAPIで提供されます。一つは意図解釈やカスタム語彙に強いモデル。もう一つはストリーミング文字起こしと言語切り替えに対応したモデルです。
性能は大幅に向上しました。前世代のChirp 3と比較して、最終的な文字起こしまでの時間は70%改善したとしています。これはArtificial Analysisによる測定結果です。
多言語性能も強化されました。FLEURSベンチマークにおいて、ストリーミングモードで5.50%、非ストリーミングで5.04%の単語誤り率 (WER) を達成したといいます。
このモデルは既にAndroidのRamblerやmacOS向けGeminiアプリなどで活用されています。また、LangChainやVercelなどのプラットフォームを通じて、高性能な音声インターフェースの構築が可能です [HN Search (backfill)]。
出典: Gemini-3.5-Transcribe(HN 362pt・127コメント)(HN Search (backfill)、2026-08-28)