注目★★★★★GitHub Trending
AirLLM、70B モデルを 4GB GPU 1 枚で推論—量子化なし
30秒で把握
- 1AirLLM が FP8・AutoModel 対応で v3.0 へ—DeepSeek-V3(671B)を 12GB で実行
- 2層ごとストリーミング加載で量子化不要・Kimi K3(2.8T)も 4GB 以下で動作可能
- 3Linux/macOS/CPU 対応・pip install で即導入・主要モデル自動検出で実装コスト最小化
要約
AirLLM は大規模言語モデルの推論メモリ使用量を劇的に削減し、量子化・蒸留・プルーニング無しで 70B モデルを 4GB GPU で実行できる。405B Llama 3.1 を 8GB で、671B DeepSeek-V3 を約 12GB で、2.8T Kimi K3 を 4GB 未満で動作させられるのは、MoE モデルが層全体ではなく 1 つのエキスパートずつストリーミング加載するため。v3.0 は FP8 モデル対応を追加し、AutoModel インターフェースで Qwen・Llama・DeepSeek など主要モデルを自動検出・初期化する。Linux・macOS (Apple Silicon)・CPU 推論にも対応。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約