Asayomu Tech
注目★★★★★Hugging Face Papers

ENEAS、SAM 3の見失いと誤認を防ぐテキスト追跡

30秒で把握

  • 1ENEASがテキスト指示の物体追跡と概念別インスタンス発見を統合
  • 2時間メモリで画面外への消失後も追跡し近接撮影で全体分割
  • 3視覚照合と条件付きVLM検証で彫像や反射の誤認を抑制

要約

ENEASは、テキスト指示による単一物体の追跡と、指定概念に該当する全インスタンスの発見を1つの手法で実現した。追跡ではSeCアーキテクチャにテキスト入力と時間メモリを加え、対象が画面外へ消えた後も再登場まで追跡を維持し、極端な近接撮影でも物体全体を保持する。発見では視覚embeddingで候補を高速照合し、曖昧な候補だけをVLMで意味検証する。これにより、彫像・絵画・反射など見た目が似る対象をターゲットと誤認する問題を抑え、3D再構成向けの動画や順不同データの追跡・分割に対応する。

あなたへの影響

動画解析や3D再構成を行う日本のエンジニアは、対象の消失・再登場、極端な近接、視覚的な類似物を含むデータでENEASを評価するとよい。

推奨:VLMは曖昧な候補に限定して使う構成のため、精度とレイテンシーのトレードオフも検証しやすい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。