Nari Labsは、2026時点において、同社の音声AIモデルがText-to-Speech (TTS)およびSpeech-to-Text (STT)の両方でCovalのvoice AIベンチマークをリードしていると発表しました。Covalは、音声AIエージェントに対する業界標準の評価を提供しており、単語誤り率(WER)やレイテンシなどの重要な指標を測定しています。

STTベンチマークにおいて、Qwen3-ASR FastモデルはTime-to-Final-Segment (TTFS)で第1位となり、中央値は44 ms、WERは3.6%を記録しました。TTSベンチマークでは、Qwen3-TTS FastモデルがTime-to-First-Audio (TTFA)において63 msで第2位となり、WERでは3.8%で第1位を達成しました。Nari Labsは、同モデルは公式のQwen3 TTS Flash Realtimeエンドポイントと同じアーキテクチャを共有しているものの、同社のサービスは大幅に低いレイテンシと高い精度を提供していると言及しています。

同社はまた、エンドポイントのコスト効率についても強調しました。Qwen3-TTS Fastモデルは、Covalの価格ディレクトリにおいて$10 per 1文字あたりという、最低価格でタイに輝いています。Qwen3-ASR Fastモデルは、公開レートを持つモデルの中で、$0.12 per時間あたりという、2番目に低い価格でタイとなっています。


情報源: