Hugging Faceは、Transformersライブラリ内でGGUFモデルを効率的に実行するためのサポートを追加しました。このアップデートにより、ユーザーはHugging Face Hubからチェックポイントをロードすることで、ローカルメモリ向けに最適化された大規模言語モデルを、使い慣れたTransformers APIを通じて直接実行できるようになります。
Transformersが効率的なGGUFモデルの実行をサポート
この記事は翻訳です。 原文を読む
lama.cppチームによって開発されたGGUFは、モデルの重みとメタデータを単一のファイルにパッケージ化する、ローカル 推論 用の広く普及しているフォーマットです。これは様々な 量子化 レベルをサポートしており、ユーザーは一定の精度と引き換えに、メモリ使用量を削減することが可能です。
llama.cppに近いパフォーマンスを実現するため、Transformersは kernels ライブラリを通じて基盤となるggmlカーネルを再利用し、generate 関数におけるオーバーヘッドを削減しています。この統合の初期の焦点はApple Silicon上でのローカル 推論 であり、最初の実装としてQwen3.5 アーキテクチャが採用されています。Metal環境で実行するユーザーの場合、ローダーは互換性のあるggml/Metalレイヤーのカーネルを自動的に使用します。
この統合は、ローカル 推論 の基盤となるllama.cppと、モデル定義の基盤となるTransformersの間のギャップを埋めることを目的としています。llama.cppがネイティブではサポートしていない可能性のあるモデルにggmlのパフォーマンスをもたらすことで、このアプローチは、研究用モデルや新しいマルチモーダルなモダリティを含む、より幅広いアーキテクチャを加速させる機会を広げます。
出典
- Transformers now runs llama.cpp quants (Hugging Face Blog, 2026-09-22)
- Update on GitHub