Asayomu Tech
注目★★★★★Hugging Face Papers

実業務セッションから852タスク生成、企業エージェントの実力を測るベンチマーク

30秒で把握

  • 1EnterpriseClawBench が実業務セッションから 852 タスクを生成・公開
  • 2最良構成 GPT-5.5 + Codex でもスコア 0.663 止まり・単一指標が不十分と判明
  • 3評価プロトコルは GitHub 公開済み・多軸評価フレームの設計に活用可能

要約

FrontisAIはEnterpriseClawBenchを発表した。実際の職場セッションアーカイブから852の再現可能なタスクを生成し、企業エージェントを評価するベンチマークだ。各タスクにはプロンプト・ロール定義・スキル分類・ハードルール・セマンティックルーブリックが付与される。内部データを含むため公開は行わず、構築・評価プロトコルのみを再利用可能な形で提供する。

あなたへの影響

単一スコアによる企業エージェント評価の限界が示されたため。

推奨:社内にエージェント導入を検討するチームは複数軸(成果物品質・コスト・スキル転移)での評価フレームワークを設計する必要が出てくる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。