注目★★★★★Hugging Face Papers
OVO-S-Bench:マルチモーダルLLMの空間認識を評価する階層型ベンチマーク
要約
ロボットやAR、自動運転向けのマルチモーダルエージェントが映像ストリームから空間を理解する能力を測る新ベンチマーク「OVO-S-Bench」が公開された。348本の動画から1,680問を収録し、12名のアノテーターが804人時をかけて構築した。38のモデルを評価した結果、最高性能のGemini-2.5-Proでも人間の86.6点に対して59.2点にとどまった。特にアロセントリックマッピング(俯瞰的空間把握)が主要な課題として浮き彫りになっている。
あなたへの影響
空間認識系MLLMの研究・評価に取り組むチームにとって有益な比較基準となる。
推奨:即時対応は不要だが、ストリーミング映像を扱うシステムを開発中のチームは参考情報として目を通す程度で良い。