注目★★★★★Hacker News
Flux 3、画像・動画・音声を統合学習するマルチモーダル基盤モデル公開
30秒で把握
- 1Black Forest Labs が FLUX 3 発表。画像・動画・音声を統一アーキテクチャで学習する初のマルチモーダル基盤モデル
- 2動画生成で Runway 比 77%・Luma Ray 比 93% の評価優位。ロボット制御予測(FLUX-mimic)も同時展開
- 3API・重み公開・オープンウェイト版(FLUX 3 Dev)を段階的ロールアウト。ビジョン+動力学の統一モデルが業界標準化へ
要約
Black Forest Labs が、画像・動画・音声を同一アーキテクチャで学習するマルチモーダル基盤モデル「FLUX 3」のアーリーアクセスを開始した。Self-Flow アプローチを拡張し、複数のモダリティ間の相互制約(音は衝撃に合致、動きは質量に従う等)から世界の統一表現を学習する。動画生成では Runway Gen-4.5 比 77%、Luma Ray 3.2 比 93% で評価者に選好され、テキストから 20 秒の動画+音声生成、画像編集、ロボット制御予測に対応する。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約