注目★★★★★Hugging Face Papers
Marigold V2、単眼深度を16〜26%改善
30秒で把握
- 1Marigold V2がDiT転用で単眼深度推定を単一ステップ化
- 2KITTI・ETH3DのAbsRelを従来最高比16〜26%改善
- 3DINOv3整合とSinkhorn損失で細い輪郭と分布外汎化を向上
要約
Marigold V2は、Diffusion Transformerを単眼深度推定へ転用し、単一ステップ推論で従来モデルより鮮明な深度マップを生成する手法を公開した。KITTIとETH3DでAbsRelを従来最高モデル比16〜26%改善し、分布外入力でも高い汎化性能を示した。DINOv3由来の意味特徴との表現整合と、Sinkhornベースの2段階ファインチューニングで、毛皮・葉・髪のような細い輪郭を再現する。深度推定に加え、表面法線やIntrinsic Image Decompositionでも最先端性能を達成した。4bit量子化とrank-128 QLoRAにより、32GBのコンシューマGPU 1台で学習できる構成も示した。
あなたへの影響
単眼深度を使うロボティクスや画像処理の開発チームは、KITTI・ETH3Dなど自社対象に近いデータでMarigold V2の精度と単一ステップ推論のメモリ使用量を次スプリントで検証すべき。
推奨:Sinkhorn lossは画素単位の対応が崩れた教師データにも対応する損失関数で、合成データ利用時の評価項目になる。