日本語

リリース

llama.cpp v0.5.0 パブリックリリース — バックエンドのパフォーマンス最適化とモデルサポートの拡大

この記事は翻訳です。 原文を読む

llama.cpp は、バックエンドのパフォーマンス、正確性、およびモデル対応の拡大に焦点を当てたバージョン 0.5.0 をリリースしました。今回のアップデートには、CUDA および Metal の最適化、より堅牢なサーバー運用、そして複数の新しいモデルアーキテクチャへの対応が含まれています。

新機能と改善

  • パフォーマンスの最適化:
    • implicit GEMM を使用した CUDA conv2d の加速。
    • Metal MoE および SSM_CONV の融合(fusion)最適化を追加。
    • MTP ドラフト用の CUDA graphs を有効化。
  • 新しいモデルのサポート:
    • HRM-Text (DFM Mimir 1B) のサポートを追加。
    • MiMo-V2.6 への変換サポート、および DFlash を介した HunyuanOCR のサポートを追加。
    • Nemotron MTP および Nemotron-H モデルのサポートを拡張。
    • Qwen4Exp ハイパーコネクト操作および sparse flash attention を追加。
  • サーバーおよび API の強化:
    • --host を介してサーバーが複数のアドレスにバインドできるように変更。
    • サーバーのファンクションコール出力に input_image サポートを追加。
    • JSON Schema および PEG の処理を改善。
    • temperature、top-p、min-p、およびペナルティのための環境変数を追加。

バグ修正

  • サーバーのスリープ中にトークンカウント API がクラッシュする問題を修正。
  • 融合 QKV モデルにおけるテンソル並列(tensor-parallel)の分割状態と粒度の問題を修正。
  • 縦長/横長の画像における SigLIP バッファオーバーランを修正。
  • モバイルのブレイクポイントやコンテンツのオーバーフロー問題を含む、さまざまな UI の問題を解決。
  • Ling 3.0、DeepSeek V3.2/V4、qwen3-coder、Muse Glimmer、および Gemma 4 に関する複数のパーサーエラーを修正。

出典

  1. v0.5.0 (2026-09-23)