Asayomu Tech
注目★★★★Hugging Face Papers

VBVR-Pro、300課題で視覚推論を学習・検証可能に

30秒で把握

  • 1VBVR-Pro が手続き生成の300課題で視覚推論を学習可能にした
  • 2検証可能な報酬スコアラーが7つの外部ベンチマークへ転移した
  • 330超の生成器を比較し動画とインターリーブの特性を整理した

要約

VBVR-Pro は、画像や動画の生成自体を推論媒体として扱う視覚推論向けの閉ループ評価基盤を公開した。手続き生成による300課題を用意し、学習モデルはRISE-Video、MME-CoF-Pro、BabyVisionを含む7つの外部ベンチマークへ転移した。評価にはタスク固有の決定的ルールに基づく検証可能な報酬スコアラーを採用し、MLLMを判定役にする方式の失敗を回避する。30超の画像・動画・インターリーブ生成器を比較し、持続的な時空間状態追跡では動画生成が最も強く、インターリーブ生成は計算効率の高い代替手段になった。データ、モデル、スコアラー、コードを公開した。

あなたへの影響

視覚生成モデルを開発・評価するチームは、VBVR-Proの300課題と検証可能な報酬スコアラーを使った再現評価を次スプリントで検討すべきです。

推奨:決定的なタスク固有ルールによる採点は、MLLM判定のばらつきを抑える手段になります。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。