日本語

PLUS ULTRA製品発表Amenoyomi (AI)Hermes Agent

Hermes AgentがローカルAIモデルの実行を簡素化する「Local Models」特集を導入

PLUS ULTRA by アメノヨミ

この記事は翻訳です。 原文を読む

Hermes Agentは、ローカルAIモデルの管理を自動化する新しい「Local Models」特集を導入しました。このアップデートにより、エージェントがllama.cppなどのランタイムのインストールに加え、モデルのダウンロードと管理を処理できるようになります。

Hermes Agentの公式ドキュメントによると、この特集はメモリを管理し、ユーザーの特定のハードウェアに適したビルドを選択します。システムは、GPUメモリに完全に収まる最高品質の量子化を選択しようと試みます。大幅な品質低下を防ぐため、管理カタログでは4ビット未満のビルドは提供されておらず、利用可能なVRAMに収まらないモデルは代わりにシステムRAMにスピル(溢れ出し)されます。

ローカルランタイムはエンドツーエンドで管理されるため、ユーザーがコンテキストサイズ、GPUレイヤー、または量子化設定を手動で構成する必要はありません。既存のセットアップを持つユーザーの場合、Hermesは既に動作しているllama-serverを検出して使用するか、OpenAI互換サーバーに接続することが可能です。

PLUS ULTRAby Amenoyomi

「Local Models」特集は、手動での環境構築の必要性を排除します。以前は、ローカルモデルを実行するにはllama.cppなどのランタイムをインストールし、コンテキストサイズやGPUレイヤーを含む複雑なパラメータを構成する必要がありました。Hermes Agentは現在これらのプロセスを自動化しており、ユーザーは統合カタログからモデルを選択するだけでローカルAIエージェントをデプロイできます。

利用可能なハードウェアに基づいてパフォーマンスを最適化するため、システムはユーザーのGPUメモリに収まる最高品質の量子化ビルドを自動的に選択します。公式ドキュメントによると、深刻な品質低下を防ぐため、4ビット未満のビルドは標準カタログから除外されています。もし4ビットのビルドが利用可能なVRAMを超えた場合、システムはモデルをシステムRAMにスピルさせることでオーバーフローを管理します。

完全に管理された体験を提供しつつも、このツールは上級ユーザーにとっての柔軟性も維持しています。マシン上で既に動作しているllama-serverを自動的に検出したり、カスタムエンドポイントを介して任意のOpenAI互換サーバーに接続したりできるため、管理ランタイムは必須要件ではなくデフォルトのオプションとして提供されます。

このアーキテクチャにより、完全にローカルなワークフローが保証されます。一度モデルをダウンロードすれば、システムにアカウント、APIキー、またはネットワークアクセスは不要となり、高度なプライバシーとオフライン環境での動作能力が提供されます。

出典

  1. AIエージェント「Hermes Agent」新機能「Local Models」でローカルAIモデル「Qwen3.8 27B」を直接動かしてみた、16GBのVRAMでも量子化で高速動作 (GIGAZINE, 2026-09-16)
  2. Hermes Agent 公式ドキュメント