Asayomu Tech
注目★★★★★Hugging Face Papers

AdaPlanBench: LLMエージェントの制約適応計画を評価する新ベンチマーク

要約

LLMエージェントが段階的に開示される制約下で計画・再計画できるかを評価するベンチマーク「AdaPlanBench」が提案された。307件の家庭内タスクを基に、世界制約とユーザー制約の二重制約を付与した動的対話型設計を採用している。エージェントが制約違反の計画を提案したとき初めて制約が開示され、反復的な修正が求められる。主要LLM10モデルの実験では、最高精度でも67.75%にとどまり、制約が蓄積するほど性能が低下した。ユーザー制約への対応が特に困難で、物理的な根拠推論の弱さが失敗要因として観察された。

あなたへの影響

LLMエージェントの実用的な計画能力に関心があるリサーチャーや開発者にとって、現状の限界を定量的に把握できる参考資料となる。

推奨:即時の実装対応は不要で、エージェント設計の改善指針として必要時に目を通す程度で良い。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。