日本語

モデル発表GoogleGemini 3.5 Transcribe

Googleが音声文字起こしモデルGemini 3.5 Transcribeを公開

Gemini 3.5 Transcribeは、音声から直接、整形済みのテキストに変換するSpeech-to-Textモデルです。背景ノイズや専門用語、言い淀みなどの処理に特化しています。

モデルは2種類のAPIで提供されます。一つは意図解釈やカスタム語彙に強いモデル。もう一つはストリーミング文字起こしと言語切り替えに対応したモデルです。

性能は大幅に向上しました。前世代のChirp 3と比較して、最終的な文字起こしまでの時間は70%改善したとしています。これはArtificial Analysisによる測定結果です。

多言語性能も強化されました。FLEURSベンチマークにおいて、ストリーミングモードで5.50%、非ストリーミングで5.04%の単語誤り率 (WER) を達成したといいます。

このモデルは既にAndroidのRamblerやmacOS向けGeminiアプリなどで活用されています。また、LangChainやVercelなどのプラットフォームを通じて、高性能な音声インターフェースの構築が可能です [HN Search (backfill)]。


出典: Gemini-3.5-Transcribe(HN 362pt・127コメント)(HN Search (backfill)、2026-08-28)