日本語

リリース

MLX v0.32.3 リリース — 広範なバグ修正とバックエンドのパフォーマンス向上

この記事は翻訳です。 原文を読む

MLX は、CPU、Metal、CUDA を含むさまざまな実行バックエンド全体での安定性とパフォーマンスの向上に焦点を当てたバージョン 0.32.3 をリリースしました。

主な改善点と新機能

  • Metal の最適化: Metal ベクトルアテンションにおける D512 のサポートを追加し、gated delta nets 用の Metal カーネルを導入。さらに fast.cross_entropy 用の融合(fused)Metal カーネルを実装しました。
  • パフォーマンスとスケーリング: I/O がマシンに合わせてスケーリングできるよう、アダプティブ・ローディングの並列数制限を調整。また、非量子化 matmuls(行列積)向けに M5 Ultra のチューニングを追加しました。
  • CUDA の強化: GPU フェンス待ちのためのネイティブイベントを実装し、gather_qmm にグローバルスケール・サポートを追加しました。
  • Python API の改善: put_along_axis において axis パラメータを任意(optional)に設定し、unstack がリストの代わりにタプルを返すよう更新しました。

バグ修正

  • バックエンドの安定性: mx.clear_streams() が GIL を保持することによって発生するデッドロック、CPU バックエンドにおける整数によるゼロ除算クラッシュ、Metal における SDPA(Scaled Dot-Product Attention)のメモリ使用量の改善を含む、いくつかの重大な問題を修正しました。
  • データの整合性: arg reduction における NaN の伝播、コンパイル済みカーネルにおける浮動小数点定数の精度、および遅延ロードされるファイルの保存時における破損に関する問題に対処しました。
  • 全般的な修正: GGUF テンソル次元のバリデーション、ellipsis インデックスによるクラッシュ、および macOS CI 関連のいくつかのハングアップに関する問題を解決しました。

情報源

出典

  1. v0.32.3 (2026-09-29)