注目★★★★★Hugging Face Papers
動画生成AIの視覚推論、最強モデルでも正答率51.0%
30秒で把握
- 1VGI-Bench が動画生成モデルの視覚推論を27タスクで評価
- 2810インスタンスで検証・Seedance 2.0も達成率51.0%にとどまる
- 3後段処理は初期仮説を精緻化し推論誤りを直しにくい
要約
研究チームは、動画生成モデルの視覚推論能力を測るベンチマーク「VGI-Bench」を公開した。27タスク・810インスタンスを収録し、動画の最終状態だけでなく、変化する視覚プロセスの妥当性も評価する。評価では、最強モデルのSeedance 2.0でも基準達成率は51.0%にとどまり、現行モデルの推論は信頼性に欠けた。後段の生成処理は初期仮説を修正せず精緻化する傾向があり、自己修正能力も限定的だった。
あなたへの影響
動画生成モデルを視覚推論に利用する日本の開発チームは、見栄えだけでなく変化過程を含むタスクでモデル性能を検証する必要がある。
推奨:初期推論の誤りが後段で直らない可能性があるため、本番用途では出力の段階的な検証を組み込むべき。