ByteShapeはQwen 3.8 27B向けのフル版ShapeLearnモデルをリリースしました。これにより、低ビット長でも高品質を維持するためにハイブリッド量子化技術を活用した、新しいGGUF量子化バージョンが提供されます。これらのモデルは、以前にリリースされたShapeLearn-Liteバージョンに代わるものです。
モデル発表ByteShapeQwen3.8-27BShapeLearn
ByteShapeがQwen 3.8 27B向けShapeLearn量子化モデルをリリース
この記事は翻訳です。 原文を読む
今回のリリースには、スループットとモデル精度のバランスをとるために設計されたさまざまな構成が含まれています。6種類の異なるGPUを用いたベンチマークにおいて、ShapeLearnモデルは一貫してパフォーマンスの最前線(performance frontier)に位置しており、これは、テストされた他のモデルで、より高速かつより高精度なものが存在しないことを意味します。例えば、NVIDIA RTX 5090,において、GPU-5構成は、BF16ベースラインの総合ベンチマークスコアの99.63%を維持しつつ、毎秒93.7トークンの推論速度を達成しました。
また、これらのモデルはスループットを向上させるための投機的デコーディング(speculative decoding)をサポートしています。ユーザーは、ファイルサイズが約250 MB増加する組み込みのMTP(Multi-Token Prediction)ヘッド、または追加で約1.1 GBのVRAMを必要とするInco AIの外部ドラフトモデル「DFlash2」のいずれかを利用できます。テストの結果、ほとんどのケースにおいてDFlash2の方がMTPよりも高いスループット向上を実現し、ベースラインの次トークン予測スループットの1.34–2.10xに達することが示されました。
出典
- Shapelearn Qwen 3.8 27B (13.1 GB VRAM) (Hacker News Frontpage, 2026-09-18)
- Hugging Face