Asayomu Tech
注目★★★★Hugging Face Papers

LLaDA-Image、6Bモデルで高精度編集と2〜4ステップ生成

30秒で把握

  • 1LLaDA-Imageが6B DiTと凍結視覚言語モジュールを統合
  • 2Qwen-Image-Benchで英語53.53・中文53.38を獲得
  • 3Turbo版は2〜4ステップ推論・重みと学習コードを公開

要約

LLaDA-Imageは、スクラッチ学習した6BのDiffusion Transformerと、凍結した視覚言語理解モジュールを統合した画像生成・編集モデルを公開した。画像のみの事前学習と中間学習を先行し、生成パイプラインには2億2000万サンプルを使用した。Qwen-Image-Benchで英語53.53、中文53.38を獲得し、両トラックのオープンソースモデルで最高性能を達成した。蒸留版LLaDA-Image-Turboは2〜4ステップで推論でき、モデル重み・学習コード・詳細な学習レシピも公開した。

あなたへの影響

画像生成・編集基盤を開発する日本のエンジニアは、公開された重みと学習コードを使い、LLaDA-Image-Turboの2〜4ステップ推論を次の評価スプリントで検証するとよい。

推奨:DiTはDiffusion Transformer、Muonは最適化手法を指す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。