注目★★★★★GitHub Trending
Apple Silicon 向け LLM サーバー oMLX、メニューバーから KV キャッシュと連続バッチ処理を管理
30秒で把握
- 1oMLX v1.0、連続バッチ処理・2層 KV キャッシュで Apple Silicon ローカル LLM 運用を簡素化
- 2RAM + SSD 2 段階キャッシュでコンテキスト再計算を削減・メニューバーから直感操作・OpenAI API 互換
- 3GLM-5.2 等のカスタムカーネル構築で最大 30 倍高速化・要 Xcode・Homebrew/DMG で導入可能
要約
jundot が macOS 向け LLM 推論サーバー oMLX を公開した。連続バッチ処理と 2 段階 KV キャッシュ (RAM ホット層・SSD コールド層) により、メモリ不足時に過去の会話コンテキストを SSD に自動保存・再利用できる。macOS メニューバーから直接サーバーを管理でき、モデルの ピン留め・自動アンロード・LRU 削除が可能。Apple Silicon (M1〜M4) 搭載 Mac 上で Homebrew または.dmg インストーラーで導入でき、OpenAI API 互換エンドポイント (/v1) で接続できる。GLM-5.2 など一部モデルは ネイティブカスタムカーネルで約 30 倍高速化 (845 vs 29 tok/s on M3 Ultra) を実現する。
あなたへの影響
Apple Silicon の Mac 環境で Claude Code などのツール連携を前提にローカル LLM を常時運用したいチームは、インストール・設定・継続実行の負荷が大きく削減できる可能性がある。
推奨:ただし最大性能を得るにはネイティブカーネルをビルドする必要があり、Xcode フルインストール環境の準備が前提になる点に注意。