Asayomu Tech
注目★★★★★Hugging Face Papers

SR-REAL: 強化学習で空間VLMに二経路推論を実装

30秒で把握

  • 1SR-REALが言語推論(LOR)と3D検出推論(DTR)を単一VLMに統合
  • 2冷間スタートSFT後にRL最適化・複数空間ベンチマークでベースラインを超過
  • 32経路同時学習で相互強化効果を確認・複雑な空間推論タスクに対応

要約

空間視覚言語モデル(Spatial VLM)向けに、強化学習を活用した二経路推論フレームワーク「SR-REAL」が提案された。言語だけで逐次推論する LOR と、3D幾何キュー(中心点・バウンディングボックス)を検出してから推論する DTR の2経路を単一モデルで同時サポートする。冷間スタートの教師ありファインチューニングで LOR/DTR の思考連鎖を構築し、その後 RL で精度・フォーマット報酬を最適化することで、複数の空間推論ベンチマークでベースラインを上回った。

あなたへの影響

深度・距離・シーン関係など多段推論が必要な空間タスクを扱うVLMの開発者は、SR-REALの二経路設計(LOR/DTR)とRL報酬設計を実装の参考にできる。

推奨:即時対応は不要だが、空間認識AIの研究・開発チームには有用なアーキテクチャ知見として一読する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。