Hugging Faceは、3.5億パラメータのLFM2.5-350Mモデルにおいて、構造化出力の正確性を高めるための低コストなファインチューニング手法を公開しました。
350M規模のモデルに対しGRPOを用いた構造化出力の改善手法を公開
この手法は、TRLライブラリとGroup Relative Policy Optimization (GRPO)を使用します。学習には約500のサンプルと100のステップが必要で、ColabやKaggleの無料枠のGPUでも実行可能な規模となっています。
IFStructベンチマークを用いた評価では、ベースモデルの遵守率22.6%が、ファインチューニング後は29.7%に向上したと報告されています。
この取り組みは、モデルが要求されたスキーマに従って、解析可能な形式で出力できる能力を向上させることを目的としています。
出典: Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps(Hugging Face Blog、2026-09-03)