注目★★★★★Hugging Face Papers
SenseNova-U1.5、4K対応の8B統合視覚モデルを公開
30秒で把握
- 1SenseNova が8B-MoTの統合視覚モデルU1.5を公開
- 2encoder・VAEなしで理解・推論・生成、ネイティブ4Kに対応
- 3文字描画・画像編集などの専門家能力を蒸留で統合
要約
SenseNova は SenseNova-U1.5 を公開した。8B-MoTモデルとして、encoderとVAEを使わず、視覚理解・推論・生成を単一の構成で実行する。空間的に一貫したpatch再構成、厳選した生成・編集データ、最大4Kのネイティブ解像度で学習を強化した。視覚美学、バイリンガル文字描画、インフォグラフィック生成、画像編集の専門家モデルを、multi-expert on-policy distillationで統合した。評価では画像の忠実度、文字描画、複雑な構図、複数参照編集、交互生成、指示追従、被写体同一性を改善した。教師あり微調整、強化学習、on-policy distillationの学習コードをオープンソース化する。
あなたへの影響
画像生成・編集基盤を開発する日本のエンジニアは、4K入力、文字描画、複数参照編集を含む評価と学習コードの再現性を近日中に検証するとよい。
推奨:encoder-free・VAE-freeは、画像理解と生成を単一モデルで扱う構成を指す。