注目★★★★★Hugging Face Papers
EarlyEval、LLMエージェント評価を最大44.1%省トークン化
30秒で把握
- 1EarlyEval が途中挙動から成功・失敗を予測し評価を早期停止
- 23 ベンチマークで入力トークン最大44.1%、出力29.4%削減
- 3予測精度89〜97%、解決率への影響は平均1〜2ポイント
要約
EarlyEvalは、LLMエージェントの途中経過から成功・失敗を予測し、実行を早期停止して評価コストを削減するフレームワークだ。LightGBMの成功・失敗分類器が行動、テキスト、参照解の特徴量を分析し、調整済み信頼度の閾値を超えた時点で停止する。SWE-bench Verified、TerminalBench、Toolathlonの3ベンチマークで、エージェントのステップ数を13〜26%、入力トークンを最大44.1%、出力トークンを最大29.4%削減した。予測精度は89〜97%で、エージェント単位の解決率への影響は平均1〜2ポイントにとどまった。
あなたへの影響
LLMエージェントの評価基盤を運用するチームは、既存ベンチマークで早期停止によるコスト削減と解決率への影響を検証するとよい。
推奨:途中挙動から結果を予測するため、信頼度閾値と誤停止の監視設計が必要になる。