注目★★★★★Hugging Face Papers
LLMエージェントの長期計画力を1,665ツール規模で評価するPlanBench-XL
30秒で把握
- 1PlanBench-XLが1,665ツール・327タスクでLLM計画能力を評価
- 2GPT-5.4が障害条件下で正解率51.90%→11.36%に急落
- 3障害シナリオの設計を自社エージェントのテスト設計に活用できる
要約
PlanBench-XLは、1,665ツール・327タスクで構成されるLLMエージェント向けインタラクティブベンチマークで、大規模ツール環境での長期計画能力を評価する。GPT-5.4はツール障害なしの設定で51.90%の正解率を達成したが、最も厳しい障害条件下では11.36%まで精度が崩壊した。エージェントはエラー信号が明示されない障害や、代替ツール経路が長くなるケースで特に脆弱であることも判明した。この結果は、現状のLLMが不完全なツール環境での堅牢な適応的計画にはまだ遠いことを示している。
あなたへの影響
RAGやツール連携を本番環境に組み込む場合、ツール障害時の挙動が最大のリスク要因になり得る。
推奨:PlanBench-XLの障害シナリオは自社エージェント設計のストレステスト指標として参考になる。