注目★★★★★GitHub Trending
LingBot-Map:ストリーミング映像から 3D シーンをリアルタイム再構築する基盤モデル
30秒で把握
- 1Robbyant が LingBot-Map 公開、ストリーミング 3D 再構築を ~20 FPS で実現・最長 10,000 フレーム対応
- 2Geometric Context Transformer で軌跡ドリフト補正と効率的 KV キャッシュ注意機構を統合・KITTI/Oxford ベンチで既存手法上回る
- 3GPU メモリ・推論速度の制約下で長大映像列の再構築が必要なら、キーフレーム戦略とウィンドウモード設定を試す
要約
Robbyant チームは LingBot-Map を公開した。フィードフォワード型の 3D 基盤モデルで、ストリーミング映像から 3D シーンをリアルタイムに再構築する。Geometric Context Transformer 設計により座標グラウンディング・幾何情報・軌跡のドリフト補正を統一フレームで処理し、~20 FPS で 10,000 フレーム超の長大映像列に対応可能な効率的推論を実現した。
あなたへの影響
3D 再構築をオンライン推論で実現する技術は、ドローン・ロボット・AR/VR アプリの基盤となるため。
推奨:動作環境 (CUDA / FlashInfer / PyTorch バージョン) との互換性確認と、自社映像・センサーデータでの実装検証を並行して進めると良い。