Asayomu Tech
注目★★★★★Hugging Face Papers

複数ステップのタスクで LLM エージェント精度 80% 超へ、状態管理フレームワーク「LongHorizon-Harness」

30秒で把握

  • 1LongHorizon-Harness が MEA ループで タスク状態を実行ロジックと分離、複数モデルで精度向上を実証
  • 2Qwen 3.7-Plus で WeaveBench 51.8→80.7%、Terminal-Bench 69.7→77.2%、OSWorld 2.8→8.3% に改善
  • 3長期マルチステップ実行の エージェントハーネスの標準化と相互運用性向上を検証

要約

LongHorizon-Harness は長期的な推論とツール利用を要する多段階タスクで、LLM エージェントの精度を大幅に向上させるフレームワークを提案した。従来のエージェント実行環境では、タスク状態と実行コンテキストが混在し追跡が困難で、誤った自己評価が後続決定に伝播する問題があった。本フレームワークはタスク状態を実行ロジックの外に明示的に分離し、Manage-Execute-Audit (MEA) ループで、マネージャが状態管理・次タスク決定、エグゼキューターが実行、監査役が環境状態を検証する役割を分担する。Qwen 3.7-Plus で WeaveBench 51.8% → 80.7%、Terminal-Bench 2.1 で 69.7% → 77.2%、OSWorld 2.0 で 2.8% → 8.3% の成績向上を確認し、複数モデル・実行環境で一貫した改善を示した。

あなたへの影響

LLM エージェントを本番で多段階のワークフロー (自動化ツール操作・マルチステップ推論など) に運用するチームにとって。

推奨:状態追跡と検証の改善は誤り蓄積の低減に直結し、タスク完了率向上の有力な手法として参考になる価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。