ある開発者が、Core MLとNeural Engine (ANE) を使用してApple Silicon上でローカルにTyped Decisionsを実行可能にする、Layaのオープンウェイトポート版であるlaya-coremlをリリースしました。この実装により、PyTorch、Transformers、またはMLXを必要とせずに、オフラインでの推論が可能になります。
M3 Maxで実施されたベンチマークでは、ANE FP16を使用し、短い多言語の意思決定タスクにおいて、P50レイテンシが4.98 ms、P95が5.31 msを記録しました。この実装は大幅なエネルギー効率の向上を示しており、コンパイル済みのMLX FP16と比較して、意思決定あたりのシステム全体のエネルギー消費が2.78倍優れていることが測定されました。また、W8量子化版では、エネルギー効率がさらに3.19倍向上しています。
このプロジェクトは、3つの600ステップのエピソードを通じて、秒間49.1から50.0回の意思決定を維持する「Snake」ゲームループを実証しています。自己回帰モデルとは異なり、このアプローチはトークンの生成やJSONパースを必要とせず、選択肢の確率、順序スコア、およびブール値の回答を提供します。
この実装には、既存のLayaモデルをCore ML形式に変換するツールが含まれており、Python用の推論ホイールも提供されています。ANEに最適化されたバージョンは、短いクエリに対して高いパフォーマンスを示しますが、開発者は、長いコンテキストに対する現在のアダプターの性能や、MLXに対する連続的なフルゲームのスピードアップについては、さらなる検証が必要であると述べています。
出典
- Laya (OS Jev) on Mac M4 CoreML Offline (45 decisions per second) (Hacker News Frontpage, 2026-09-20)
- GitHubリポジトリ