日本語

製品発表Ollama

Ollama v0.34.1 リリース — パフォーマンス向上とMLXのアップデート

この記事は翻訳です。 原文を読む

Ollama v0.34.1 がリリースされ、パフォーマンスの最適化、およびMLXとllama.cppの統合に関するアップデートが提供されました。

新機能および改善点

  • APIパフォーマンス: 大規模なモデルライブラリの管理において、/api/tags エンドポイントが大幅に高速化されました。テストの結果、コールドスタート時のレスポンスタイムが 3.1 秒から 294 msへと短縮されたことが示されています。
  • MLXの強化: Apple SiliconにおけるMLXのメモリ管理が改善されました。
  • モデル作成: ollama create において、MLX safetensors が実験的段階ではなくなりました。GGUFモデルの作成には、safetensorへの変換のためにllama.cppのツールと 量子化 を使用することが必要になります。
  • ツール更新: MLXとllama.cppの両方にアップデートが行われました。

バグ修正

  • 繰り返しトークンの検出: 誤検知(OCRなどで発生するものなど)を減らすため、暴走する繰り返しトークンの検出には、トリガーとして 100 個の繰り返しトークンが必要になります。
  • 非推奨化: typical_p パラメータは非推奨となり、新しいモデルの作成時に設定することはできなくなりましたが、既存のGGUFモデルへのサポートは継続されています。

出典

  1. v0.34.1 (2026-09-14)