注目★★★★★Hugging Face Papers
長時間タスク対応エージェント評価ベンチマーク「Long-Horizon-Terminal-Bench」公開
30秒で把握
- 1Hugging Face が長時間ターミナルタスク 46 種類のベンチマークを公開・9 カテゴリ・細粒度部分点評価
- 2従来は最終完了のみ評価・本ベンチマークは中間プロセスと部分的進捗を可視化・実用的な弱点把握
- 315 モデル評価で最高達成率 15.2%・平均 9.9M トークン消費・85.3 分実行・長期計画能力の課題顕在化
要約
Hugging Face の研究チームは、長時間実行が必要な 46 タスク (実験再現・ソフトウェア開発・マルチモーダル分析など) で AI エージェントの能力を評価するベンチマーク「Long-Horizon-Terminal-Bench」を発表した。従来のターミナルベンチマークはタスク完了のみで評価していたが、本ベンチマークは中間プロセスを細粒度の部分点で採点し、部分的な進捗や未完成の成果物を可視化する。実験では 15 のフロンティアモデルを評価し、タスク当たり平均 9.9M トークン消費、約 231 エピソード・85.3 分の実行時間を要することが判明した。最も性能の高いモデルでも達成率は 15.2% にとどまり、長期計画と文脈管理が大きな課題と判明した。
あなたへの影響
エージェント技術を研究・導入するチームは、本ベンチマークで示された低い達成率が自社システムの実装難易度推定の参考になり。
推奨:長時間ワークフローの段階的検証や複合タスク設計の見直しが必要になる可能性がある。