Asayomu Tech
注目★★★★★Hugging Face Papers

動画を見て調べる AI エージェント、Claude 超える精度 64% 実現

30秒で把握

  • 1Video-DeepResearch-35B が動画質問応答で 64.0% 精度達成、Claude-4.5-Sonnet 上回る
  • 2モダリティバイアス・知識漏洩の 2 課題に対し段階的ツール解禁と GRPO 学習で対処
  • 3200 件の複雑マルチホップ VQA タスク (Video-DR-Bench) で評価・コード公開予定

要約

Hugging Face の研究チームは、静止画から動画ストリームへと対応を拡張したマルチモーダル AI エージェント「Video-DeepResearch」を発表した。既存モデルの課題として、テキスト検索に頼りすぎる「モダリティバイアス」と内部知識に依存する「パラメトリック知識漏洩」を特定し、段階的なツール解禁と二段階学習 (監督微調整 + GRPO) で解決した。200 件の複雑な動画質問応答タスク (Video-DR-Bench) で、Video-DeepResearch-35B が平均精度 64.0% を達成し、Claude-4.5-Sonnet (59.0%) を 5 ポイント上回り、GPT-5 (52.5%) や Gemini 2.5 Pro (57.5%) を大幅に凌駕した。

あなたへの影響

動画コンテンツを扱うシステムや研究開発チームにとって、複雑な映像クエリに答えるアプローチの参考になります。

推奨:ただし公開モデルの入手可能性や日本語対応は記事に記載されていないため、実運用前にまずベンチマーク内容と学習方法を確認することをお勧めします。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。