Asayomu Tech
注目★★★★Hugging Face Papers

SenseNova-U1.5、4K対応の8B統合視覚モデルを公開

30秒で把握

  • 1SenseNova が8B-MoTの統合視覚モデルU1.5を公開
  • 2encoder・VAEなしで理解・推論・生成、ネイティブ4Kに対応
  • 3文字描画・画像編集などの専門家能力を蒸留で統合

要約

SenseNova は SenseNova-U1.5 を公開した。8B-MoTモデルとして、encoderとVAEを使わず、視覚理解・推論・生成を単一の構成で実行する。空間的に一貫したpatch再構成、厳選した生成・編集データ、最大4Kのネイティブ解像度で学習を強化した。視覚美学、バイリンガル文字描画、インフォグラフィック生成、画像編集の専門家モデルを、multi-expert on-policy distillationで統合した。評価では画像の忠実度、文字描画、複雑な構図、複数参照編集、交互生成、指示追従、被写体同一性を改善した。教師あり微調整、強化学習、on-policy distillationの学習コードをオープンソース化する。

あなたへの影響

画像生成・編集基盤を開発する日本のエンジニアは、4K入力、文字描画、複数参照編集を含む評価と学習コードの再現性を近日中に検証するとよい。

推奨:encoder-free・VAE-freeは、画像理解と生成を単一モデルで扱う構成を指す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。