Asayomu Tech
注目★★★★Hacker News

Gemma 4 26B を M1/M2 Mac で 2GB RAM で動かす推論エンジン

30秒で把握

  • 1Gemma 4 26B を 4 ビット量子化し M シリーズ Mac で 2GB RAM のみで推論可能に実現
  • 214GB の重みを SSD ストリーミングと RAM キャッシュ分離で読み込み、M2 で 5~6 tok/s を達成
  • 3GitHub で Mac アプリ版と OpenAI 互換サーバーを公開、エッジ AI 実装の参考になる

要約

開発者が TurboFieldfare という Swift/Metal ベースの推論エンジンを作成し、M シリーズ Mac で 4 ビット量子化された Gemma 4 26B モデルを約 2GB の RAM で実行することに成功した。14GB の量子化重みを全メモリに載せられない制約に対し、共有レイヤーと KV キャッシュのみを RAM に保持し、必要な専門家モデルだけを SSD からストリーミング転送する手法を採用した。M2 MacBook Air で秒当たり 5~6 トークン、M3 MacBook Pro で 31~35 トークンの生成速度を達成した。OpenAI 互換のローカルサーバー機能も実装され、ストリーミングとツール呼び出しに対応している。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。