日本語

モデル発表CactusNeedle

CactusがGeminiを蒸留した26Mの関数呼び出しモデルNeedleを公開

Needleは、スマートフォンやスマートウォッチなどのコンシューマーデバイスでの動作を想定した実験的なモデルです。コンシューマーデバイス上で、プリフィル6000tok/s、デコード1200tok/sの速度で動作すると発表しています。

アーキテクチャには「Simple Attention Networks」を採用しました。MLPを完全に排除し、アテンションとゲーティングのみで構成されています。ツール呼び出しは推論ではなく、クエリとツール名の照合や引数の抽出といった「検索と組み立て」であるという見解に基づいています [Hacker News]。

学習には、16台のTPU v6eを用いて200Bトークンの事前学習を27時間行いました。その後、Geminiを用いて合成した15のツールカテゴリ(タイマー、メッセージ、ナビゲーション等)を含む2Bトークンのデータで45分間のポストトレーニングを実施したとしています。

開発者は、外部の構造化知識にアクセスするタスクにおいてFFN(フィードフォワードネットワーク)は不要であるとの知見を得たと述べています。シングルショットの関数呼び出しでは、FunctionGemma-270MやQwen-0.6Bなどのモデルを上回る結果が出たとしています [Hacker News]。

本プロジェクトは、モバイルやウェアラブル向けの推論エンジンCactusの一部です。モデルの重みはHugging Faceで、コードはGitHubでMITライセンスとして公開されています。


出典: Show HN: Needle: We Distilled Gemini Tool Calling into a 26M Model(HN 776pt・211コメント)(HN Search (backfill)、2026-05-13)