Asayomu Tech
注目★★★★Hugging Face Papers

リアルタイム音声・映像対話の MOSS-VL 開発、オープンソース初の生成中知覚に対応

30秒で把握

  • 1MOSS-VL は発話中にリアルタイム映像知覚する視覚言語モデル、ゲーテッドクロスアテンション と合成対話コーパスで実装
  • 2オフライン性能競合、ストリーミング 4 ベンチ中 3 つで最高・能動行動テストで 66.0 (従来 37.5) を達成
  • 3初トークン時間が同等バックボーン比 2.8〜5.1 倍高速化、全チェックポイント・カリキュラム・推論コード公開

要約

OpenMOSS は MOSS-VL を発表した。視覚言語モデルが発話しながら映像フレームを知覚するリアルタイム対話を第一級の機能として実装した。言語デコーダが ゲーテッドクロスアテンション を通じてのみ映像に注目することで、生成中に新規フレームを自然に処理でき、合成対話コーパスが発話タイミングと沈黙・修正を学習させる。MOSS-VL-Instruct はオフライン性能で同規模モデルと競合し、映像時系列推論ベンチで優位、MOSS-VL-Realtime は 4 つのストリーミングベンチで開放ソース同等の中で 3 つで最高平均を獲得、OmniMMI Proactive Alerting では能動行動テストで 66.0 (ベースライン 37.5) と大幅上回を実現した。11.3B パラメータながら視覚トークンが復号化対象外のため、Qwen3-VL-8B 同等バックボーンと比べ初トークン生成時間を視覚文脈の拡大に伴い 2.8 倍から 5.1 倍へと伸張させた。

あなたへの影響

映像に反応しながら発話するリアルタイム機能は、ライブ配信監視・医療現場・工業プロセスモニタリングなど低遅延が直結する場面で価値が高い。

推奨:自社のマルチモーダル AI システムにリアルタイム対話を組み込むチームは、本論文の ゲーテッドクロスアテンション 設計と段階的訓練カリキュラムの解析と検証を次の R&D サイクルに組み込む価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。