同社チームは、計算リソースを非同期で連携する「islands(島)」構造に分割する手法を開発しました。これにより、一部で障害が起きても他部分が学習を継続できます。
モデル発表Google DeepMindDecoupled DiLoCo
DeepMind、分散学習アーキテクチャ「Decoupled DiLoCo」を公開
従来の同期型アプローチは、数千枚のチップを完全な同期で保つことが物流的に困難でした。Decoupled DiLoCoは、この制約を解消します。
本技術は、非同期データフローの「Pathways」と、帯域幅削減を実現した「DiLoCo」を統合しています。チップ故障の影響を局所化し、システム全体の停止を防ぎます。
「Chaos engineering」による検証では、学習ユニット全体が失われた後も訓練を維持しました。復旧後はシームレスに再統合されます。
Gemma 4モデルでのテストでは、従来の手法と同様のベンチマーク性能を示しました。障害発生時のクラスタ可用性は向上しています。
さらに、米国4地域にまたがる120億パラメータモデルの事前学習を成功させました。広域ネットワークは2〜5Gbpsで、既存のインターネット接続で実現可能な水準です。
従来の同期方式より20倍以上高速でした。通信を長い期間に分散させる設計が、この速度向上につながっています。
出典: Decoupled DiLoCo: Resilient, Distributed AI Training at Scale(HN 49pt・6コメント)(HN Search (backfill)、2026-04-28)