Asayomu Tech
注目★★★★Hacker News

Apple Silicon VM での LLM 推論が 11~16 倍高速化、Metal シェーダー最適化で

30秒で把握

  • 1Cua が macOS VM 内の llama.cpp LLM 推論を 11~16 倍高速化する Metal 互換性シェーダを公開
  • 2Virtualization.framework の仮想 GPU が古い Metal ファミリを報告することが原因・プロセス単位で新しいカーネルを有効化
  • 3TinyLlama・Gemma 4・Muse Glimmer で検証済・コード・ベンチマークログ・再現方法を公開

要約

Cua チームが macOS 仮想マシン内の llama.cpp LLM 推論を大幅に高速化する Metal 互換性シェーダを公開した。M1 Ultra 上の TinyLlama 1.1B で、プロンプト処理が 11.08 倍、トークン生成が 16.36 倍高速化し、ベアメタル比 98% の速度に到達した。Apple の Virtualization.framework が仮想 GPU に対して Apple 5 世代のメタルファミリを報告していたため、llama.cpp が古いカーネルを選択していたのが原因で、プロセススコープの互換性レイヤーが Apple 9 ファミリとスレッドグループメモリを偽装することで解決した。Gemma 4 12B でもプロンプト処理 7.20 倍・トークン生成 14.54 倍、Muse Glimmer 30B でもそれぞれ 7.55 倍・8.87 倍の高速化を達成し、同じコードとベンチマークログを公開している。

あなたへの影響

自社 macOS VM で LLM 推論を運用するチームは、同じシェーダ層を適用することで既存環境の変更なしに 7~16 倍の高速化が期待できるため、コード・ベンチマーク公開を参考に導入検討する価値がある。

推奨:ただし Metal 機能セットの報告変更スコープは限定的 (Apple ファミリと threadgroup メモリのみ) で、異なる Apple Silicon 世代・macOS バージョン・llama.cpp ビルドでの動作確認は別途必要。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。