Asayomu Tech
注目★★★★★Hugging Face Papers

OVO-S-Bench:マルチモーダルLLMの空間認識を評価する階層型ベンチマーク

要約

ロボットやAR、自動運転向けのマルチモーダルエージェントが映像ストリームから空間を理解する能力を測る新ベンチマーク「OVO-S-Bench」が公開された。348本の動画から1,680問を収録し、12名のアノテーターが804人時をかけて構築した。38のモデルを評価した結果、最高性能のGemini-2.5-Proでも人間の86.6点に対して59.2点にとどまった。特にアロセントリックマッピング(俯瞰的空間把握)が主要な課題として浮き彫りになっている。

あなたへの影響

空間認識系MLLMの研究・評価に取り組むチームにとって有益な比較基準となる。

推奨:即時対応は不要だが、ストリーミング映像を扱うシステムを開発中のチームは参考情報として目を通す程度で良い。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。