注目★★★★★Hugging Face Papers
実業務セッションから852タスク生成、企業エージェントの実力を測るベンチマーク
30秒で把握
- 1EnterpriseClawBench が実業務セッションから 852 タスクを生成・公開
- 2最良構成 GPT-5.5 + Codex でもスコア 0.663 止まり・単一指標が不十分と判明
- 3評価プロトコルは GitHub 公開済み・多軸評価フレームの設計に活用可能
要約
FrontisAIはEnterpriseClawBenchを発表した。実際の職場セッションアーカイブから852の再現可能なタスクを生成し、企業エージェントを評価するベンチマークだ。各タスクにはプロンプト・ロール定義・スキル分類・ハードルール・セマンティックルーブリックが付与される。内部データを含むため公開は行わず、構築・評価プロトコルのみを再利用可能な形で提供する。
あなたへの影響
単一スコアによる企業エージェント評価の限界が示されたため。
推奨:社内にエージェント導入を検討するチームは複数軸(成果物品質・コスト・スキル転移)での評価フレームワークを設計する必要が出てくる。