研究者たちは、汎用的な大規模言語モデル(LLM)が、高速な「システム1」的な意思決定モデルとして機能できることを実証しました。これは、単一のフォワードパスを通じて、利用可能なすべての選択肢に対する信頼度値とともに、選択された選択肢を出力するように設計された特化型モデルを指します。トークンの確率分布を読み取るこの手法は、完全なJSONオブジェクトの生成や、推論モデルの使用に伴う高いレイテンシとコストを回避します。
GLM-5.3-Flashは、Jevのような特化型意思決定モデルと同等の性能を発揮
この記事は翻訳です。 原文を読む
Privatemodeプラットフォーム上でGLM-5.3-Flashを用いた評価を行ったところ、この手法は28のテキストベースのデータセットにおいて、TypeSafe社のJevと同等の意思決定精度を達成しました。Jevは、いくつかのケースにおいて依然としてより費用対効果が高く、わずかに高い精度を維持していますが、GLM-5.3-Flashの設定は汎用性の面で大きな利点を提供します。JevやLayaとは異なり、スキャンされた請求書のような画像に対しても型付きの意思決定が可能です。
この手法は、モデルに選択肢のリストから特定のインデックスを選択するようにプロンプトを送り、その位置の対数確率を読み取るというものです。回答の前にモデルの推論能力を使用すると精度は向上しますが、コストとレイテンシも大幅に増加します。例えば、GLM-5.3-Flashを用いた推論は、100万回の意思決定あたり約350ユーロのコストがかかったのに対し、シングルトークンによる意思決定アプローチでは0.062ユーロでした。
テキストデータセットにおいて、GLM-5.3-FlashとJevの精度の差の中央値は、Jevが0.7パーセントポイント上回っていましたが、統計的に有意な差は見られませんでした。しかし、選択肢の数が増えると、両システムともに精度が低下する傾向があります。例えば、TRECデータセットでは、選択肢の数が6から42に増加すると、精度は91.2%から79.6%に低下しました。
出典
- Turning GLM-5.3-Flash into a Jev-like decision model (Hacker News Frontpage, 2026-09-26)
- GitHub benchmark repository
他1件の出典出典を閉じる
- Calling the AI bluff: Adding "Do not guess" cut made-up fields from 71% to 20% (Hacker News Frontpage, 2026-09-27)