Asayomu Tech
注目★★★★★Hugging Face Papers

VisualClaw:リアルタイム動作・自己進化型マルチモーダルエージェント

30秒で把握

  • 1VisualClawがフルフレーム比APIコストを平均98%削減・精度も向上
  • 2EgoSchema+Gemini 3 Flashで平均+3.85%・最大+15.80%の精度改善
  • 3200シナリオのエージェント型ベンチマークVisualClawArenaも同時公開

要約

VisualClawは、VLMのコスト・レイテンシ・静的スキャフォールドという3つの課題を解決する自己進化型マルチモーダルエージェントだ。カスケードゲートによるフレームフィルタリングとhot/cold top-k注入によるスキルバンク圧縮で、フルフレームアップロード比でAPIコストを平均98%削減した。失敗から学ぶスキル進化機能により、EgoSchemaベンチマークでGemini 3 Flash使用時に平均+3.85%・最大+15.80%の精度向上を達成した。また、映像証拠・文書・動的更新・実行可能チェックを組み合わせた200シナリオのエージェント型ベンチマーク「VisualClawArena」も公開した。

あなたへの影響

動画を扱うVLMの本番運用コストに課題を感じているチームは、フレーム選択とスキルバンク圧縮の組み合わせアプローチが実装の参考になり得る。

推奨:VisualClawArenaはエージェント型タスクの評価基盤として、自社ベンチマーク設計の比較対象にもなり得る。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。