Cactus Computeは、スマートフォン、ウェアラブルデバイス、ロボット、スマートホーム、マイクロコントローラなどのリソース制約のある環境向けに特別に設計された基盤モデルであるNeedle 3,をリリースしました。モデルのサイズは、2-bit量子化形式において8 MBから29 MBの範囲です。
Cactus ComputeがNeedle 3,をリリース、モバイル向けに「インテリジェンス・ラダー」を備えた基盤モデルを提供
この記事は翻訳です。 原文を読む
Needle 3は、「Laddered Simple Attention Network」アーキテクチャを採用しています。このアプローチは、2から20レイヤーまでのすべての深さがスタンドアロンでデプロイ可能なサブネットワークとして機能する「インテリジェンス・ラダー」を構築します。これにより、開発者は特定のハードウェア制約に合わせてサブネットワークのサイズを選択できます。開発者によれば、わずか29百万パラメータからスタートするにもかかわらず、ダウンストリームタスクでファインチューニングされた4-layerのサブネットワークは、DeepSeek V4 Flashの性能に匹敵するとのことです。
このモデルは、自動化タスク、特にツール呼び出し(tool calling)と構造化データの抽出に最適化されています。2-bit 量子化と独自のSimple Attention Networkを使用することで、汎用的なチャット能力を抑える代わりに、小型デバイスにおける関数呼び出しとテキスト抽出の精度を向上させています。「DroidCall」データセットなどの特定のタスク向けにファインチューニングを行うと、サブネットワークは18から36ポイントという大幅な性能向上を示しました。
実装に向けて、Cactus ComputeはPythonパッケージと1 MB未満の推論エンジンを提供しています。このエンジンは、幅広いデプロイ対象をサポートするために、Linux-arm64やmacOS-arm64を含むさまざまなプラットフォーム向けにビルド可能です。
出典: 情報源:
- Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 Flash (Hacker News Frontpage, 2026-09-18)
- GitHub