注目★★★★★Hugging Face Papers
LLaDA-Image、6Bモデルで高精度編集と2〜4ステップ生成
30秒で把握
- 1LLaDA-Imageが6B DiTと凍結視覚言語モジュールを統合
- 2Qwen-Image-Benchで英語53.53・中文53.38を獲得
- 3Turbo版は2〜4ステップ推論・重みと学習コードを公開
要約
LLaDA-Imageは、スクラッチ学習した6BのDiffusion Transformerと、凍結した視覚言語理解モジュールを統合した画像生成・編集モデルを公開した。画像のみの事前学習と中間学習を先行し、生成パイプラインには2億2000万サンプルを使用した。Qwen-Image-Benchで英語53.53、中文53.38を獲得し、両トラックのオープンソースモデルで最高性能を達成した。蒸留版LLaDA-Image-Turboは2〜4ステップで推論でき、モデル重み・学習コード・詳細な学習レシピも公開した。
あなたへの影響
画像生成・編集基盤を開発する日本のエンジニアは、公開された重みと学習コードを使い、LLaDA-Image-Turboの2〜4ステップ推論を次の評価スプリントで検証するとよい。
推奨:DiTはDiffusion Transformer、Muonは最適化手法を指す。