注目★★★★★Hugging Face Blog
LFM2.5-VL-3B、3Bモデルで画像理解とツール呼び出しを大幅強化
30秒で把握
- 1Liquid AI が LFM2.5-VL-3B 公開・34T トークン事前学習で画面理解・グラウンディング・関数呼び出し強化
- 2GPU 秒間 11K トークン出力・M5 Max で秒間 228 トークンのオンデバイス推論対応・メモリ約 3GB
- 3llama.cpp・MLX・vLLM など推論フレームワーク初日対応・低遅延ビジョンタスク向けオプション拡大
要約
Liquid AI は視覚言語モデル LFM2.5-VL-3B を公開し、画面・UI 理解、オブジェクト検出、複数画像推論、関数呼び出しの 4 項目を大幅に改善した。34T トークンで事前学習され、約 3GB メモリで動作し、M5 Max で秒間 228 トークンのオンデバイス推論に対応する。GPU 推論では H100 単一機でも秒間約 11,000 トークンの出力スループットを実現し、既存 4B クラスモデルの約 2 倍の速度を達成した。llama.cpp・MLX・vLLM など主要推論フレームワークで初日からサポートされ、ドキュメント理解・グラウンディング・OCR・ツール呼び出しで実用レベルの精度を確保している。
あなたへの影響
3B クラスモデルながら GPU スループットで上位モデルに匹敵し、オンデバイス推論 (Galaxy S26 Ultra で秒間 20 トークン) も可能なため、低遅延の画像処理が必要なチーム向けに有力な選択肢になる。
推奨:画面読み取り・ツール呼び出し強化により、ローカル実行の RPA・UI 自動化への適用が現実的になった。