注目★★★★★Hugging Face Papers
快手、長時間動画対応MoEマルチモーダルモデル Keye-VL-2.0-30B-A3B を公開
30秒で把握
- 1快手が Keye-VL-2.0-30B-A3B を公開・同規模モデル最高水準を達成
- 2DSA で 256K コンテキスト対応・推論時アクティブパラメータは 3B のみ
- 3MOPD + Context-RL で忘却を抑制・Code / Tool / Search エージェント対応
要約
快手(Kwai)はオープンソースのMixture-of-Experts(MoE)マルチモーダル基盤モデル「Keye-VL-2.0-30B-A3B」を公開した。DeepSeek Sparse Attention(DSA)をGQAベースのマルチモーダルアーキテクチャに初めて適用し、256Kコンテキストをロスレスで処理しながら時間的依存関係を捉える。総パラメータ30Bながら推論時は3Bのみ起動するMoE構造を採用し、Cross-Modal Multi-Teacher On-Policy Distillation(MOPD)とContext-RL・Video-RLを組み合わせてカタストロフィック・フォゲッティングを抑制した。動画理解・時間的グラウンディング・推論・STEM・エージェントの各ベンチマークで同規模モデル最高水準の性能を達成している。
あなたへの影響
長時間動画(時間単位)を扱うマルチモーダルAIを実装・評価しているチームは、同規模オープンソースモデルとの性能比較に本モデルをベンチマーク候補に加える価値がある。
推奨:推論時アクティブパラメータが3Bに抑えられているため、GPU資源が限られた環境での検証コストを下げられる可能性がある。