Asayomu Tech
注目★★★★Hacker News

Kimi K3、2.8Tパラメータのオープンウェイト最大モデル——推論効率化とNoPE採用が特徴

30秒で把握

  • 1Kimi K3 がオープンウェイト最大級 2.8T パラメータで公開・48B の Kimi Linear からスケールアップ
  • 2LatentMoE・Attention Residuals・NoPE 全面採用で推論効率化・学習コスト 4%・推論 2% の追加
  • 3ネイティブマルチモーダルサポート搭載・RoPE 廃止は大規模モデルの標準設計の参考値になる

要約

Kimi K3 は昨年リリースされた Kimi Linear (48B) をスケールアップした 2.8T パラメータの大規模オープンウェイトモデルで、現在公開されている最大級だ。新たに LatentMoE を採用し、通常の MoE・Attention・RoPE を効率化版に置き換え、推論効率の向上を実現した。Attention Residuals は層間の残差接続を注意スコアで重み付けし、検証損失と下流タスク性能を改善しながら学習コスト 4%・推論コスト 2% の追加負荷に留めた。RoPE をすべて廃止し NoPE (No Positional Embeddings) を採用したフロンティアレベルのモデルは初だ。ネイティブマルチモーダルサポートも搭載した。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。