Asayomu Tech
注目★★★★★Hugging Face Papers

EarlyEval、LLMエージェント評価を最大44.1%省トークン化

30秒で把握

  • 1EarlyEval が途中挙動から成功・失敗を予測し評価を早期停止
  • 23 ベンチマークで入力トークン最大44.1%、出力29.4%削減
  • 3予測精度89〜97%、解決率への影響は平均1〜2ポイント

要約

EarlyEvalは、LLMエージェントの途中経過から成功・失敗を予測し、実行を早期停止して評価コストを削減するフレームワークだ。LightGBMの成功・失敗分類器が行動、テキスト、参照解の特徴量を分析し、調整済み信頼度の閾値を超えた時点で停止する。SWE-bench Verified、TerminalBench、Toolathlonの3ベンチマークで、エージェントのステップ数を13〜26%、入力トークンを最大44.1%、出力トークンを最大29.4%削減した。予測精度は89〜97%で、エージェント単位の解決率への影響は平均1〜2ポイントにとどまった。

あなたへの影響

LLMエージェントの評価基盤を運用するチームは、既存ベンチマークで早期停止によるコスト削減と解決率への影響を検証するとよい。

推奨:途中挙動から結果を予測するため、信頼度閾値と誤停止の監視設計が必要になる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。