注目★★★★★Hugging Face Blog
LFM2.5-350M、GRPO 100ステップで構造化出力29.7%
30秒で把握
- 1LFM2.5-350MをGRPO微調整し、IFStruct合格率を22.6%から29.7%へ向上
- 2約500サンプル・100ステップ・LoRA約600万パラメータで学習を実施
- 3JSON合格率は18.0%から31.9%へ上昇、YAMLは27.2%から27.5%で横ばい
要約
Hugging Face は、LiquidAI/LFM2.5-350Mを約500サンプルでGRPO微調整し、IFStructの合格率を22.6%から29.7%へ引き上げた。LoRAで約600万パラメータ(モデルの1.66%)を学習し、JSON形式・フィールド数・JSON Schema準拠の報酬を重み付きで最適化した。JSONの合格率は18.0%から31.9%へ上昇した一方、YAMLは27.2%から27.5%とほぼ変わらなかった。Qwen3.5-2Bの33.15%には届かないが、小型モデルでもタスク特化の微調整で大規模モデルとの差を縮められた。
あなたへの影響
構造化出力を使う日本の開発チームは、既存モデルに形式・Schema検証の評価を追加し、少量データでのLoRA・GRPO微調整を次の検証候補にできる。
推奨:GRPOは複数の生成結果に報酬を与えて学習する手法で、用途別の評価設計が性能を左右する可能性がある。