Appleの機械学習研究者たちは、事前学習中にモデルの言語識別能力を高めることが、多言語自己教師あり音声モデルにおける言語性能を向上させることを示しました。
言語識別が多言語音声モデルにおける言語学習を向上させる
この記事は翻訳です。 原文を読む
多言語モデルは、同じ事前学習予算内では単一言語モデルの性能に及ばないことがよくありますが、本研究では言語識別がこの差を縮小、あるいは解消できることを実証しています。研究者らは、制御された英語/フランス語のHuBERT設定を用い、「補助的な言語分類器」と「言語ごとのk-meansターゲット」という2つの介入策をテストしました。
その結果、さまざまな指標において向上が見られました。音素識別エラー率は、バイリンガル・ベースラインの11.6%から10.4%へと減少し、単一言語レベルの10.8%に近づきました。語彙性能(sWUGGY)は52.1%から56.7%に上昇し、韻律性能(ProsAudit、語彙サブタスク)は68.9%から72.9%へと上昇し、単一言語ベースラインの72.6%を上回りました。
研究者らは、言語識別を学習の最初のイテレーション(反復)で導入したときに、最も大きな効果が得られることを発見しました。後から、あるいは繰り返し介入を行った場合は、改善の幅が小さくなり、言語ごとの分離が進む結果となりました。これらの知見は、言語識別が、多言語学習において通常必要とされる追加の計算コストを削減する上で、因果的な役割を果たしていることを示唆しています。
出典
- Language Discrimination Improves Linguistic Learning in Multilingual Speech Models (Apple Machine Learning, 2026-10-02)
- arXiv