日本語

製品発表Hugging FaceTransformers

Transformersが効率的なGGUFモデルの実行をサポート

この記事は翻訳です。 原文を読む

Hugging Faceは、Transformersライブラリ内でGGUFモデルを効率的に実行するためのサポートを追加しました。このアップデートにより、ユーザーはHugging Face Hubからチェックポイントをロードすることで、ローカルメモリ向けに最適化された大規模言語モデルを、使い慣れたTransformers APIを通じて直接実行できるようになります。

lama.cppチームによって開発されたGGUFは、モデルの重みとメタデータを単一のファイルにパッケージ化する、ローカル 推論 用の広く普及しているフォーマットです。これは様々な 量子化 レベルをサポートしており、ユーザーは一定の精度と引き換えに、メモリ使用量を削減することが可能です。

llama.cppに近いパフォーマンスを実現するため、Transformersは kernels ライブラリを通じて基盤となるggmlカーネルを再利用し、generate 関数におけるオーバーヘッドを削減しています。この統合の初期の焦点はApple Silicon上でのローカル 推論 であり、最初の実装としてQwen3.5 アーキテクチャが採用されています。Metal環境で実行するユーザーの場合、ローダーは互換性のあるggml/Metalレイヤーのカーネルを自動的に使用します。

この統合は、ローカル 推論 の基盤となるllama.cppと、モデル定義の基盤となるTransformersの間のギャップを埋めることを目的としています。llama.cppがネイティブではサポートしていない可能性のあるモデルにggmlのパフォーマンスをもたらすことで、このアプローチは、研究用モデルや新しいマルチモーダルなモダリティを含む、より幅広いアーキテクチャを加速させる機会を広げます。

出典

  1. Transformers now runs llama.cpp quants (Hugging Face Blog, 2026-09-22)
  2. Update on GitHub