Asayomu Tech
注目★★★★★GitHub Trending

Apple Silicon 向け LLM サーバー oMLX、メニューバーから KV キャッシュと連続バッチ処理を管理

30秒で把握

  • 1oMLX v1.0、連続バッチ処理・2層 KV キャッシュで Apple Silicon ローカル LLM 運用を簡素化
  • 2RAM + SSD 2 段階キャッシュでコンテキスト再計算を削減・メニューバーから直感操作・OpenAI API 互換
  • 3GLM-5.2 等のカスタムカーネル構築で最大 30 倍高速化・要 Xcode・Homebrew/DMG で導入可能

要約

jundot が macOS 向け LLM 推論サーバー oMLX を公開した。連続バッチ処理と 2 段階 KV キャッシュ (RAM ホット層・SSD コールド層) により、メモリ不足時に過去の会話コンテキストを SSD に自動保存・再利用できる。macOS メニューバーから直接サーバーを管理でき、モデルの ピン留め・自動アンロード・LRU 削除が可能。Apple Silicon (M1〜M4) 搭載 Mac 上で Homebrew または.dmg インストーラーで導入でき、OpenAI API 互換エンドポイント (/v1) で接続できる。GLM-5.2 など一部モデルは ネイティブカスタムカーネルで約 30 倍高速化 (845 vs 29 tok/s on M3 Ultra) を実現する。

あなたへの影響

Apple Silicon の Mac 環境で Claude Code などのツール連携を前提にローカル LLM を常時運用したいチームは、インストール・設定・継続実行の負荷が大きく削減できる可能性がある。

推奨:ただし最大性能を得るにはネイティブカーネルをビルドする必要があり、Xcode フルインストール環境の準備が前提になる点に注意。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。