Asayomu Tech
注目★★★★★Hugging Face Papers

VideoKR:315K動画推論データで知識集約型映像理解を強化

要約

VideoKRは、知識・推論集約型の動画理解強化を目的とした初の大規模学習コーパスです。CC ライセンスの専門ドメイン動画 145K 本から生成した 315K 件の推論例を収録しています。人間参加型のスキル指向パイプラインで難易度・多様性・信頼性を確保し、CoT 根拠付きデータを構築しました。SFT→GRPO パイプラインで事後学習したモデルは、知識集約型動画推論で従来手法を上回る結果を示しています。

あなたへの影響

動画推論モデルの研究者にとって、データ設計の重要性を示す参考事例となる。

推奨:即時アクションは不要で、動画 LLM の学習データ構築に関心があるチームが目を通す程度でよい。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。