日本語

ハードウェアBitNet

分散型推論エンジンがESP32S3クラスター上で0.5BパラメータのBitNet LLMを実行

この記事は翻訳です。 原文を読む

オープンソースプロジェクトにより、7つのESP32S3マイクロコントローラーのクラスターにわたって0.5Bパラメータの大規模言語モデル(LLM)を実行するように設計された、分散型パイプライン推論エンジンが導入されました。このシステムは、リソース制約のあるハードウェア上でのLLM実行を可能にするため、1.58ビット(BitNet)の三値量子化を利用しています。

このアーキテクチャは、マスターノード構成を採用しています。マスターノードは、BPEトークナイザー、トークン埋め込み(INT4で保存)、および最終的なRMS NormとLM Headを処理します。アテンション層やMLP(多層パーセプトロン)を含む残りの計算負荷は、計算ノードに分散されます。各ノードは、隠れ状態ベクトルを渡すために、高速SPIデイジーチェーンを介して通信します。

パフォーマンスを最適化するため、実装では1.58ビットの三値線形層に対してアセンブリで最適化されたMAC(積和演算)を使用し、極限の最適化のためにルックアップテーブルを使用しています。このプロジェクトでは、分散型のESP32S3環境に向けてモデルを準備するための、量子化、前処理、およびモデル重みのスライシングを行うためのPythonベースのツールセットを提供しています。

出典

  1. ESP32S3 cluster running 1.58-bit (BitNet) Language model (Hacker News Frontpage, 2026-09-28)