注目★★★★★Hacker News
Kimi Linear: 線形注意機構が標準アテンションを初めて上回る(48B パラメータモデル)
30秒で把握
- 1Kimi Linear が線形アテンション (KDA) でフル MLA を初めて全タスクで超過・KV キャッシュ 75% 削減・デコード 6 倍高速化
- 2短・長文脈と RL スケーリング全シーンで勝利・DPLR 最適化でハードウェア効率向上・フルアテンション直接代替が可能に
- 3KDA カーネルと vLLM 実装をオープンソース化・学習済みモデルと命令チューニング版を同時リリース・長文脈 LLM 推論の効率化を加速
要約
Kimi Linear は線形注意の一種である Kimi Delta Attention (KDA) を核とした新しいハイブリッドアーキテクチャで、短文脈・長文脈・強化学習スケーリングのすべてのシーン で標準的なフルアテンション (MLA) を初めて上回った。3B の活性パラメータと 48B 総パラメータを持つモデルは同じ学習設定で評価し、全タスクにおいてフル MLA より有意な マージンで勝利しながら KV キャッシュを最大 75% 削減、1M トークン文脈で最大 6 倍のデコード スループットを達成した。DPLR 遷移行列の専用最適化によってハードウェア効率を大幅に高め、線形注意をフルアテンションの直接代替として機能させることを実証した。研究推進のため KDA カーネルと vLLM 実装をオープンソース化し、学習済みおよび命令チューニング済みモデルをリリースした。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約