Asayomu Tech
注目★★★★Hugging Face Papers

快手、長時間動画対応MoEマルチモーダルモデル Keye-VL-2.0-30B-A3B を公開

30秒で把握

  • 1快手が Keye-VL-2.0-30B-A3B を公開・同規模モデル最高水準を達成
  • 2DSA で 256K コンテキスト対応・推論時アクティブパラメータは 3B のみ
  • 3MOPD + Context-RL で忘却を抑制・Code / Tool / Search エージェント対応

要約

快手(Kwai)はオープンソースのMixture-of-Experts(MoE)マルチモーダル基盤モデル「Keye-VL-2.0-30B-A3B」を公開した。DeepSeek Sparse Attention(DSA)をGQAベースのマルチモーダルアーキテクチャに初めて適用し、256Kコンテキストをロスレスで処理しながら時間的依存関係を捉える。総パラメータ30Bながら推論時は3Bのみ起動するMoE構造を採用し、Cross-Modal Multi-Teacher On-Policy Distillation(MOPD)とContext-RL・Video-RLを組み合わせてカタストロフィック・フォゲッティングを抑制した。動画理解・時間的グラウンディング・推論・STEM・エージェントの各ベンチマークで同規模モデル最高水準の性能を達成している。

あなたへの影響

長時間動画(時間単位)を扱うマルチモーダルAIを実装・評価しているチームは、同規模オープンソースモデルとの性能比較に本モデルをベンチマーク候補に加える価値がある。

推奨:推論時アクティブパラメータが3Bに抑えられているため、GPU資源が限られた環境での検証コストを下げられる可能性がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。