PSSAは、PyTorchやTensorFlowといった機械学習フレームワークを使用せず、Rustでゼロから記述された小型言語モデルです。標準的なTransformerアーキテクチャに見られるアテンション機構を使用する代わりに、PSSAは回帰的な状態空間層とエピソード記憶のバンクを用いてコンテキストを管理します。
プロジェクトのドキュメントによると、PSSAは、パラメータ数が一致し、同じコーパスを使用したTransformerと比較してパフォーマンスの優位性を示しています。PSSAは学習がより速く、同じCPU上でも約12倍速くテキストを生成します。この効率性は、そのアーキテクチャ設計に起因しています。Transformerの計算コストは、各ステップで文脈全体を再読するためシーケンス長に対して二次関数的に増加しますが、PSSAは固定サイズの状態を維持するため、コストの増加を線形に抑えることができます。
WikiText-103の12.7Mトークンを用いた実験では、ベースラインのTransformerが4.43の訓練クロスエントロピーを示したのに対し、PSSAは3.98を達成しました。また、未知のホールドアウトテキストにおいて、Transformerのパープレキシティが83.7であったのに対し、PSSAは53.7というより低いパープレキシティを実証しました。プロジェクトのドキュメントでは、PSSAが特定の損失しきい値にTransformerよりも大幅に早く到達することが記されています。
現在の実装には、学習、チェックポイント作成、およびデータセット管理のためのカスタムCLIが含まれています。開発者は、現在の規模では生成品質が限定的であり、より大きなパラメータサイズでの性能を検証するには、より大規模な計算リソースを用いたさらなるテストが必要であると述べています。
出典
- PSSA: A non-Transformer language model written from scratch in Rust (Hacker News Frontpage, 2026-09-30)