Ollama v0.34.1 がリリースされ、パフォーマンスの最適化、およびMLXとllama.cppの統合に関するアップデートが提供されました。
新機能および改善点
- APIパフォーマンス: 大規模なモデルライブラリの管理において、
/api/tagsエンドポイントが大幅に高速化されました。テストの結果、コールドスタート時のレスポンスタイムが 3.1 秒から 294 msへと短縮されたことが示されています。 - MLXの強化: Apple SiliconにおけるMLXのメモリ管理が改善されました。
- モデル作成:
ollama createにおいて、MLX safetensors が実験的段階ではなくなりました。GGUFモデルの作成には、safetensorへの変換のためにllama.cppのツールと 量子化 を使用することが必要になります。 - ツール更新: MLXとllama.cppの両方にアップデートが行われました。
バグ修正
- 繰り返しトークンの検出: 誤検知(OCRなどで発生するものなど)を減らすため、暴走する繰り返しトークンの検出には、トリガーとして 100 個の繰り返しトークンが必要になります。
- 非推奨化:
typical_pパラメータは非推奨となり、新しいモデルの作成時に設定することはできなくなりましたが、既存のGGUFモデルへのサポートは継続されています。
出典
- v0.34.1 (2026-09-14)