Asayomu Tech
注目★★★★Hacker News

Flux 3、画像・動画・音声を統合学習するマルチモーダル基盤モデル公開

30秒で把握

  • 1Black Forest Labs が FLUX 3 発表。画像・動画・音声を統一アーキテクチャで学習する初のマルチモーダル基盤モデル
  • 2動画生成で Runway 比 77%・Luma Ray 比 93% の評価優位。ロボット制御予測(FLUX-mimic)も同時展開
  • 3API・重み公開・オープンウェイト版(FLUX 3 Dev)を段階的ロールアウト。ビジョン+動力学の統一モデルが業界標準化へ

要約

Black Forest Labs が、画像・動画・音声を同一アーキテクチャで学習するマルチモーダル基盤モデル「FLUX 3」のアーリーアクセスを開始した。Self-Flow アプローチを拡張し、複数のモダリティ間の相互制約(音は衝撃に合致、動きは質量に従う等)から世界の統一表現を学習する。動画生成では Runway Gen-4.5 比 77%、Luma Ray 3.2 比 93% で評価者に選好され、テキストから 20 秒の動画+音声生成、画像編集、ロボット制御予測に対応する。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。