llama.cpp は、バックエンドのパフォーマンス、正確性、およびモデル対応の拡大に焦点を当てたバージョン 0.5.0 をリリースしました。今回のアップデートには、CUDA および Metal の最適化、より堅牢なサーバー運用、そして複数の新しいモデルアーキテクチャへの対応が含まれています。
新機能と改善
- パフォーマンスの最適化:
- implicit GEMM を使用した CUDA
conv2dの加速。 - Metal MoE および SSM_CONV の融合(fusion)最適化を追加。
- MTP ドラフト用の CUDA graphs を有効化。
- implicit GEMM を使用した CUDA
- 新しいモデルのサポート:
- HRM-Text (DFM Mimir 1B) のサポートを追加。
- MiMo-V2.6 への変換サポート、および DFlash を介した HunyuanOCR のサポートを追加。
- Nemotron MTP および Nemotron-H モデルのサポートを拡張。
- Qwen4Exp ハイパーコネクト操作および sparse flash attention を追加。
- サーバーおよび API の強化:
--hostを介してサーバーが複数のアドレスにバインドできるように変更。- サーバーのファンクションコール出力に
input_imageサポートを追加。 - JSON Schema および PEG の処理を改善。
- temperature、top-p、min-p、およびペナルティのための環境変数を追加。
バグ修正
- サーバーのスリープ中にトークンカウント API がクラッシュする問題を修正。
- 融合 QKV モデルにおけるテンソル並列(tensor-parallel)の分割状態と粒度の問題を修正。
- 縦長/横長の画像における SigLIP バッファオーバーランを修正。
- モバイルのブレイクポイントやコンテンツのオーバーフロー問題を含む、さまざまな UI の問題を解決。
- Ling 3.0、DeepSeek V3.2/V4、qwen3-coder、Muse Glimmer、および Gemma 4 に関する複数のパーサーエラーを修正。
出典
- v0.5.0 (2026-09-23)