Asayomu Tech
注目★★★★Hugging Face Blog

LFM2.5-VL-3B、3Bモデルで画像理解とツール呼び出しを大幅強化

30秒で把握

  • 1Liquid AI が LFM2.5-VL-3B 公開・34T トークン事前学習で画面理解・グラウンディング・関数呼び出し強化
  • 2GPU 秒間 11K トークン出力・M5 Max で秒間 228 トークンのオンデバイス推論対応・メモリ約 3GB
  • 3llama.cpp・MLX・vLLM など推論フレームワーク初日対応・低遅延ビジョンタスク向けオプション拡大

要約

Liquid AI は視覚言語モデル LFM2.5-VL-3B を公開し、画面・UI 理解、オブジェクト検出、複数画像推論、関数呼び出しの 4 項目を大幅に改善した。34T トークンで事前学習され、約 3GB メモリで動作し、M5 Max で秒間 228 トークンのオンデバイス推論に対応する。GPU 推論では H100 単一機でも秒間約 11,000 トークンの出力スループットを実現し、既存 4B クラスモデルの約 2 倍の速度を達成した。llama.cpp・MLX・vLLM など主要推論フレームワークで初日からサポートされ、ドキュメント理解・グラウンディング・OCR・ツール呼び出しで実用レベルの精度を確保している。

あなたへの影響

3B クラスモデルながら GPU スループットで上位モデルに匹敵し、オンデバイス推論 (Galaxy S26 Ultra で秒間 20 トークン) も可能なため、低遅延の画像処理が必要なチーム向けに有力な選択肢になる。

推奨:画面読み取り・ツール呼び出し強化により、ローカル実行の RPA・UI 自動化への適用が現実的になった。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。