注目★★★★★Hacker News
Kimi K3、2.8Tパラメータのオープンウェイト最大モデル——推論効率化とNoPE採用が特徴
30秒で把握
- 1Kimi K3 がオープンウェイト最大級 2.8T パラメータで公開・48B の Kimi Linear からスケールアップ
- 2LatentMoE・Attention Residuals・NoPE 全面採用で推論効率化・学習コスト 4%・推論 2% の追加
- 3ネイティブマルチモーダルサポート搭載・RoPE 廃止は大規模モデルの標準設計の参考値になる
要約
Kimi K3 は昨年リリースされた Kimi Linear (48B) をスケールアップした 2.8T パラメータの大規模オープンウェイトモデルで、現在公開されている最大級だ。新たに LatentMoE を採用し、通常の MoE・Attention・RoPE を効率化版に置き換え、推論効率の向上を実現した。Attention Residuals は層間の残差接続を注意スコアで重み付けし、検証損失と下流タスク性能を改善しながら学習コスト 4%・推論コスト 2% の追加負荷に留めた。RoPE をすべて廃止し NoPE (No Positional Embeddings) を採用したフロンティアレベルのモデルは初だ。ネイティブマルチモーダルサポートも搭載した。
あなたへの影響
Kimi K3 の設計選択 (特に RoPE 完全廃止・NoPE 統一・LatentMoE 採用) は他モデルの実装検討時の参考になる。
推奨:推論効率化は API コスト低減に直結するため、大規模モデル運用を検討するチームは公開レポートで学習・推論コストオーバーヘッドの詳細を確認し、自社ユースケースへの適用可能性を評価すべき。