Asayomu Tech
注目★★★★Hugging Face Papers

Qwen-Drive-1.0、VLMを変えず自動運転の3D認識と計画を統合

30秒で把握

  • 1Qwen-Drive-1.0がVLM本体を維持し自動運転機能を統合
  • 2BEVヘッドで3D検出・occupancy予測・map segmentationを実行
  • 3Planning Expertが共有表現から将来の自車軌道を生成

要約

Qwen-Drive-1.0は、事前学習済みVLMのアーキテクチャを維持したまま、自動運転向けの3D認識・Visual Question Answering・モーションプランニングを統合した基盤モデルだ。外部BEV認識ヘッドが3D物体検出、semantic occupancy予測、BEV map segmentationを実行し、共有表現に含まれる3D情報を検査可能にする。Planning Expertは共有VLM表現から将来の自車軌道を生成する。運転データと汎用VLMデータを段階的に学習し、一般的な視覚理解と指示追従能力を大きく保ったまま、3D認識と運転シーン理解、open-loop・pseudo-closed-loop・closed-loopの各評価で競争力のある計画性能を達成した。Qwen3.5-4Bに2つの外部モジュールを接続し、VLM本体は変更していない。

あなたへの影響

自動運転の認識・QA・軌道生成を統合したVLMを評価するチームは、Qwen3.5-4Bを基盤にBEV認識とPlanning Expertの再現性を次スプリントで検証するとよい。

推奨:BEVは鳥瞰視点表現、semantic occupancyは空間の占有状態を表す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。