注目★★★★★Hugging Face Papers
映像から世界的な空間認識ができる?VLMの弱点を検証するベンチマーク GST-Bench
30秒で把握
- 1VLM の大域的空間認識能力を測る GST-Bench 公開、6,790 分の合成動画ベース
- 2最強モデルは 42.68% で人間 79.08% に大きく遅れ、長期観察の統一表現が課題
- 3ロボット・自動運転向け VLM 検証時に GST-Bench による能力確認が推奨される
要約
研究者らは動画からの大域的空間認識を測定するベンチマーク GST-Bench を開発した。6,790 分の合成動画から生成した VQA タスクで、複数視点からの空間推論と広視野のトップダウン画像マッピングを要求する。最強の最新 VLM でも正答率 42.68% に留まり、人間の 79.08% から大きく遅れた。局所的には高い空間理解を示すモデルも、長期にわたる観察を統一的な全体像に統合できず、グローバルな一貫性を欠くことが判明した。
あなたへの影響
ロボット制御や自動運転などエンボディドエージェント開発を行うチームは、既存 VLM の長期動画理解と全体図構築能力に弱点があることを認識し。
推奨:タスク設計時の検証対象に加えるべき。