Needleは、スマートフォンやスマートウォッチなどのコンシューマーデバイスでの動作を想定した実験的なモデルです。コンシューマーデバイス上で、プリフィル6000tok/s、デコード1200tok/sの速度で動作すると発表しています。
アーキテクチャには「Simple Attention Networks」を採用しました。MLPを完全に排除し、アテンションとゲーティングのみで構成されています。ツール呼び出しは推論ではなく、クエリとツール名の照合や引数の抽出といった「検索と組み立て」であるという見解に基づいています [Hacker News]。
学習には、16台のTPU v6eを用いて200Bトークンの事前学習を27時間行いました。その後、Geminiを用いて合成した15のツールカテゴリ(タイマー、メッセージ、ナビゲーション等)を含む2Bトークンのデータで45分間のポストトレーニングを実施したとしています。
開発者は、外部の構造化知識にアクセスするタスクにおいてFFN(フィードフォワードネットワーク)は不要であるとの知見を得たと述べています。シングルショットの関数呼び出しでは、FunctionGemma-270MやQwen-0.6Bなどのモデルを上回る結果が出たとしています [Hacker News]。
本プロジェクトは、モバイルやウェアラブル向けの推論エンジンCactusの一部です。モデルの重みはHugging Faceで、コードはGitHubでMITライセンスとして公開されています。
出典: Show HN: Needle: We Distilled Gemini Tool Calling into a 26M Model(HN 776pt・211コメント)(HN Search (backfill)、2026-05-13)