注目★★★★★Hugging Face Papers
Qwen-Drive-1.0、VLMを変えず自動運転の3D認識と計画を統合
30秒で把握
- 1Qwen-Drive-1.0がVLM本体を維持し自動運転機能を統合
- 2BEVヘッドで3D検出・occupancy予測・map segmentationを実行
- 3Planning Expertが共有表現から将来の自車軌道を生成
要約
Qwen-Drive-1.0は、事前学習済みVLMのアーキテクチャを維持したまま、自動運転向けの3D認識・Visual Question Answering・モーションプランニングを統合した基盤モデルだ。外部BEV認識ヘッドが3D物体検出、semantic occupancy予測、BEV map segmentationを実行し、共有表現に含まれる3D情報を検査可能にする。Planning Expertは共有VLM表現から将来の自車軌道を生成する。運転データと汎用VLMデータを段階的に学習し、一般的な視覚理解と指示追従能力を大きく保ったまま、3D認識と運転シーン理解、open-loop・pseudo-closed-loop・closed-loopの各評価で競争力のある計画性能を達成した。Qwen3.5-4Bに2つの外部モジュールを接続し、VLM本体は変更していない。
あなたへの影響
自動運転の認識・QA・軌道生成を統合したVLMを評価するチームは、Qwen3.5-4Bを基盤にBEV認識とPlanning Expertの再現性を次スプリントで検証するとよい。
推奨:BEVは鳥瞰視点表現、semantic occupancyは空間の占有状態を表す。