Asayomu Tech
注目★★★★★Hugging Face Papers

LLMエージェントの長期計画力を1,665ツール規模で評価するPlanBench-XL

30秒で把握

  • 1PlanBench-XLが1,665ツール・327タスクでLLM計画能力を評価
  • 2GPT-5.4が障害条件下で正解率51.90%→11.36%に急落
  • 3障害シナリオの設計を自社エージェントのテスト設計に活用できる

要約

PlanBench-XLは、1,665ツール・327タスクで構成されるLLMエージェント向けインタラクティブベンチマークで、大規模ツール環境での長期計画能力を評価する。GPT-5.4はツール障害なしの設定で51.90%の正解率を達成したが、最も厳しい障害条件下では11.36%まで精度が崩壊した。エージェントはエラー信号が明示されない障害や、代替ツール経路が長くなるケースで特に脆弱であることも判明した。この結果は、現状のLLMが不完全なツール環境での堅牢な適応的計画にはまだ遠いことを示している。

あなたへの影響

RAGやツール連携を本番環境に組み込む場合、ツール障害時の挙動が最大のリスク要因になり得る。

推奨:PlanBench-XLの障害シナリオは自社エージェント設計のストレステスト指標として参考になる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。