注目★★★★★Hugging Face Papers
SR-REAL: 強化学習で空間VLMに二経路推論を実装
30秒で把握
- 1SR-REALが言語推論(LOR)と3D検出推論(DTR)を単一VLMに統合
- 2冷間スタートSFT後にRL最適化・複数空間ベンチマークでベースラインを超過
- 32経路同時学習で相互強化効果を確認・複雑な空間推論タスクに対応
要約
空間視覚言語モデル(Spatial VLM)向けに、強化学習を活用した二経路推論フレームワーク「SR-REAL」が提案された。言語だけで逐次推論する LOR と、3D幾何キュー(中心点・バウンディングボックス)を検出してから推論する DTR の2経路を単一モデルで同時サポートする。冷間スタートの教師ありファインチューニングで LOR/DTR の思考連鎖を構築し、その後 RL で精度・フォーマット報酬を最適化することで、複数の空間推論ベンチマークでベースラインを上回った。
あなたへの影響
深度・距離・シーン関係など多段推論が必要な空間タスクを扱うVLMの開発者は、SR-REALの二経路設計(LOR/DTR)とRL報酬設計を実装の参考にできる。
推奨:即時対応は不要だが、空間認識AIの研究・開発チームには有用なアーキテクチャ知見として一読する価値がある。