Appleの研究者は、潜在空間における知識蒸留(latent-space distillation)を用いて、ストリーミング・ニューラルオーディオエンコーダーを圧縮する手法を導入しました。この技術は、オーディオトークナイザー(波形のウィンドウを言語モデル用の表現にマッピングするコンポーネント)のメモリフットプリントを削減し、デバイス上での基盤モデルとのメモリ競合を緩和することを目的としています。
離散的なトークンや出力分布を対象とする従来の知識蒸留とは異なり、このアプローチでは量子化前(pre-quantizer)の潜在表現を教師信号として使用します。これにより、知識蒸留された学習モデル(student model)は、複数のトークンインターフェースをカバーすることができ、単独で、あるいは言語モデルと共同で事前学習されたモデルの恩恵を受けることが可能になります。
実験結果によると、2.8倍の圧縮において、知識蒸留された学習モデルは、ファインチューニングを行わない状態で、テストされた6組のペアのうち5組において、教師モデル(teacher model)の相対的な単語誤り率(WER)の差を1.9%以内に維持しました。また、この手法は、同等の容量を持つ独立して学習されたトークナイザーと比較して、相対的に3.9%のパフォーマンス向上を実現しました。
出典
- Compressing Streaming Neural Audio Encoders via Latent-Space 知識蒸留 (Apple Machine Learning, 2026-09-24)
- arXiv