注目★★★★★Hugging Face Papers
動画を見て調べる AI エージェント、Claude 超える精度 64% 実現
30秒で把握
- 1Video-DeepResearch-35B が動画質問応答で 64.0% 精度達成、Claude-4.5-Sonnet 上回る
- 2モダリティバイアス・知識漏洩の 2 課題に対し段階的ツール解禁と GRPO 学習で対処
- 3200 件の複雑マルチホップ VQA タスク (Video-DR-Bench) で評価・コード公開予定
要約
Hugging Face の研究チームは、静止画から動画ストリームへと対応を拡張したマルチモーダル AI エージェント「Video-DeepResearch」を発表した。既存モデルの課題として、テキスト検索に頼りすぎる「モダリティバイアス」と内部知識に依存する「パラメトリック知識漏洩」を特定し、段階的なツール解禁と二段階学習 (監督微調整 + GRPO) で解決した。200 件の複雑な動画質問応答タスク (Video-DR-Bench) で、Video-DeepResearch-35B が平均精度 64.0% を達成し、Claude-4.5-Sonnet (59.0%) を 5 ポイント上回り、GPT-5 (52.5%) や Gemini 2.5 Pro (57.5%) を大幅に凌駕した。
あなたへの影響
動画コンテンツを扱うシステムや研究開発チームにとって、複雑な映像クエリに答えるアプローチの参考になります。
推奨:ただし公開モデルの入手可能性や日本語対応は記事に記載されていないため、実運用前にまずベンチマーク内容と学習方法を確認することをお勧めします。