Asayomu Tech
最重要★★★★★Hugging Face Blog

Meta のマルチモーダル VLM「Muse Glimmer」30B モデル、オープンソース公開・ローカル推論対応

30秒で把握

  • 1Meta が Muse Glimmer 30B (ViT 2B + テキスト 28B) をオープンソース公開・マルチモーダル対応
  • 2Transformers / llama.cpp / vLLM で day-0 サポート・ローカル推論で NVIDIA/AMD/Intel GPU 対応
  • 3推測デコーディング drafter で構造化生成 (コード等) を高速化・推論コストと遅延を削減

要約

Meta が 30B パラメータのビジョン言語モデル Muse Glimmer をオープンソースで公開した。2B の ViT 型ビジョンエンコーダと 28B のテキストデコーダで構成し、画像・動画・テキストのマルチモーダル入力に対応する。Transformers / llama.cpp / vLLM など主要ライブラリで day-0 サポート提供され、ローカル GPU (NVIDIA/AMD/Intel) で即座に推論可能。ハイブリッド注意機構 (スライディングウィンドウ + 全注意の組み合わせ) と Grouped-Query Attention により生成速度と推論コストを削減し、オプションの推測デコーディング drafter を使うと構造化生成 (コード生成など) でさらに高速化される。

あなたへの影響

30B の VLM がローカルで動作可能になったため、自社データセンタや エッジデバイスでの画像・動画分析が可能になり、推論コストと応答遅延の抑制が期待できます。

推奨:transformers の最新版更新後、既存の言語モデル利用コードを最小限の変更で拡張できるため、チームは早期に動作検証と推論パイプラインの統合準備を開始すべきです。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。