Asayomu Tech
注目★★★★Hacker News

Kimi Linear: 線形注意機構が標準アテンションを初めて上回る(48B パラメータモデル)

30秒で把握

  • 1Kimi Linear が線形アテンション (KDA) でフル MLA を初めて全タスクで超過・KV キャッシュ 75% 削減・デコード 6 倍高速化
  • 2短・長文脈と RL スケーリング全シーンで勝利・DPLR 最適化でハードウェア効率向上・フルアテンション直接代替が可能に
  • 3KDA カーネルと vLLM 実装をオープンソース化・学習済みモデルと命令チューニング版を同時リリース・長文脈 LLM 推論の効率化を加速

要約

Kimi Linear は線形注意の一種である Kimi Delta Attention (KDA) を核とした新しいハイブリッドアーキテクチャで、短文脈・長文脈・強化学習スケーリングのすべてのシーン で標準的なフルアテンション (MLA) を初めて上回った。3B の活性パラメータと 48B 総パラメータを持つモデルは同じ学習設定で評価し、全タスクにおいてフル MLA より有意な マージンで勝利しながら KV キャッシュを最大 75% 削減、1M トークン文脈で最大 6 倍のデコード スループットを達成した。DPLR 遷移行列の専用最適化によってハードウェア効率を大幅に高め、線形注意をフルアテンションの直接代替として機能させることを実証した。研究推進のため KDA カーネルと vLLM 実装をオープンソース化し、学習済みおよび命令チューニング済みモデルをリリースした。

あなたへの影響

線形注意がフルアテンションを上回るのは学術的には長年の課題であり、Kimi Linear がこれを達成したことで長文脈処理やオンデバイス推論の効率化が現実的になる可能性がある。

推奨:自社モデルに組み込む場合は、KDA の既存アテンション層との置換互換性と、実運用スケール (数百 B パラメータレベル) での再現性を社内で検証してから採用判断すべき。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。