注目★★★★★Hugging Face Papers
VisualClaw:リアルタイム動作・自己進化型マルチモーダルエージェント
30秒で把握
- 1VisualClawがフルフレーム比APIコストを平均98%削減・精度も向上
- 2EgoSchema+Gemini 3 Flashで平均+3.85%・最大+15.80%の精度改善
- 3200シナリオのエージェント型ベンチマークVisualClawArenaも同時公開
要約
VisualClawは、VLMのコスト・レイテンシ・静的スキャフォールドという3つの課題を解決する自己進化型マルチモーダルエージェントだ。カスケードゲートによるフレームフィルタリングとhot/cold top-k注入によるスキルバンク圧縮で、フルフレームアップロード比でAPIコストを平均98%削減した。失敗から学ぶスキル進化機能により、EgoSchemaベンチマークでGemini 3 Flash使用時に平均+3.85%・最大+15.80%の精度向上を達成した。また、映像証拠・文書・動的更新・実行可能チェックを組み合わせた200シナリオのエージェント型ベンチマーク「VisualClawArena」も公開した。
あなたへの影響
動画を扱うVLMの本番運用コストに課題を感じているチームは、フレーム選択とスキルバンク圧縮の組み合わせアプローチが実装の参考になり得る。
推奨:VisualClawArenaはエージェント型タスクの評価基盤として、自社ベンチマーク設計の比較対象にもなり得る。