MLX は、CPU、Metal、CUDA を含むさまざまな実行バックエンド全体での安定性とパフォーマンスの向上に焦点を当てたバージョン 0.32.3 をリリースしました。
主な改善点と新機能
- Metal の最適化: Metal ベクトルアテンションにおける D512 のサポートを追加し、gated delta nets 用の Metal カーネルを導入。さらに
fast.cross_entropy用の融合(fused)Metal カーネルを実装しました。 - パフォーマンスとスケーリング: I/O がマシンに合わせてスケーリングできるよう、アダプティブ・ローディングの並列数制限を調整。また、非量子化 matmuls(行列積)向けに M5 Ultra のチューニングを追加しました。
- CUDA の強化: GPU フェンス待ちのためのネイティブイベントを実装し、
gather_qmmにグローバルスケール・サポートを追加しました。 - Python API の改善:
put_along_axisにおいてaxisパラメータを任意(optional)に設定し、unstackがリストの代わりにタプルを返すよう更新しました。
バグ修正
- バックエンドの安定性:
mx.clear_streams()が GIL を保持することによって発生するデッドロック、CPU バックエンドにおける整数によるゼロ除算クラッシュ、Metal における SDPA(Scaled Dot-Product Attention)のメモリ使用量の改善を含む、いくつかの重大な問題を修正しました。 - データの整合性: arg reduction における NaN の伝播、コンパイル済みカーネルにおける浮動小数点定数の精度、および遅延ロードされるファイルの保存時における破損に関する問題に対処しました。
- 全般的な修正: GGUF テンソル次元のバリデーション、ellipsis インデックスによるクラッシュ、および macOS CI 関連のいくつかのハングアップに関する問題を解決しました。
情報源
出典
- v0.32.3 (2026-09-29)