注目★★★★★Hacker News
Kimi K3、2.8Tパラメータのオープンウェイト最大モデル——推論効率化とNoPE採用が特徴
30秒で把握
- 1Kimi K3 がオープンウェイト最大級 2.8T パラメータで公開・48B の Kimi Linear からスケールアップ
- 2LatentMoE・Attention Residuals・NoPE 全面採用で推論効率化・学習コスト 4%・推論 2% の追加
- 3ネイティブマルチモーダルサポート搭載・RoPE 廃止は大規模モデルの標準設計の参考値になる
要約
Kimi K3 は昨年リリースされた Kimi Linear (48B) をスケールアップした 2.8T パラメータの大規模オープンウェイトモデルで、現在公開されている最大級だ。新たに LatentMoE を採用し、通常の MoE・Attention・RoPE を効率化版に置き換え、推論効率の向上を実現した。Attention Residuals は層間の残差接続を注意スコアで重み付けし、検証損失と下流タスク性能を改善しながら学習コスト 4%・推論コスト 2% の追加負荷に留めた。RoPE をすべて廃止し NoPE (No Positional Embeddings) を採用したフロンティアレベルのモデルは初だ。ネイティブマルチモーダルサポートも搭載した。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約