注目★★★★★Hugging Face Papers
AdaPlanBench: LLMエージェントの制約適応計画を評価する新ベンチマーク
要約
LLMエージェントが段階的に開示される制約下で計画・再計画できるかを評価するベンチマーク「AdaPlanBench」が提案された。307件の家庭内タスクを基に、世界制約とユーザー制約の二重制約を付与した動的対話型設計を採用している。エージェントが制約違反の計画を提案したとき初めて制約が開示され、反復的な修正が求められる。主要LLM10モデルの実験では、最高精度でも67.75%にとどまり、制約が蓄積するほど性能が低下した。ユーザー制約への対応が特に困難で、物理的な根拠推論の弱さが失敗要因として観察された。
あなたへの影響
LLMエージェントの実用的な計画能力に関心があるリサーチャーや開発者にとって、現状の限界を定量的に把握できる参考資料となる。
推奨:即時の実装対応は不要で、エージェント設計の改善指針として必要時に目を通す程度で良い。