注目★★★★★Hugging Face Papers
複数ステップのタスクで LLM エージェント精度 80% 超へ、状態管理フレームワーク「LongHorizon-Harness」
30秒で把握
- 1LongHorizon-Harness が MEA ループで タスク状態を実行ロジックと分離、複数モデルで精度向上を実証
- 2Qwen 3.7-Plus で WeaveBench 51.8→80.7%、Terminal-Bench 69.7→77.2%、OSWorld 2.8→8.3% に改善
- 3長期マルチステップ実行の エージェントハーネスの標準化と相互運用性向上を検証
要約
LongHorizon-Harness は長期的な推論とツール利用を要する多段階タスクで、LLM エージェントの精度を大幅に向上させるフレームワークを提案した。従来のエージェント実行環境では、タスク状態と実行コンテキストが混在し追跡が困難で、誤った自己評価が後続決定に伝播する問題があった。本フレームワークはタスク状態を実行ロジックの外に明示的に分離し、Manage-Execute-Audit (MEA) ループで、マネージャが状態管理・次タスク決定、エグゼキューターが実行、監査役が環境状態を検証する役割を分担する。Qwen 3.7-Plus で WeaveBench 51.8% → 80.7%、Terminal-Bench 2.1 で 69.7% → 77.2%、OSWorld 2.0 で 2.8% → 8.3% の成績向上を確認し、複数モデル・実行環境で一貫した改善を示した。
あなたへの影響
LLM エージェントを本番で多段階のワークフロー (自動化ツール操作・マルチステップ推論など) に運用するチームにとって。
推奨:状態追跡と検証の改善は誤り蓄積の低減に直結し、タスク完了率向上の有力な手法として参考になる価値がある。