Asayomu Tech
注目★★★★Hacker News

FLUX 3、ロボット制御にも対応—ビデオ生成と物理世界の理解を統合した基盤モデル

30秒で把握

  • 1Black Forest Labs と mimic が FLUX 3 を拡張、動画生成とロボット制御を単一バックボーンで実現
  • 2訓練時の品質低下は 3,500 ステップで回復、世界モデルの統合学習が実証された実績
  • 3実工場へ導入済、軽量デコーダで既存モデルに追加可能な汎用マニピュレーションプラットフォーム

要約

Black Forest Labs と mimic robotics は、画像・動画・音声を統合学習した基盤モデル FLUX 3 を、ロボット制御に拡張した FLUX-mimic を共同開発した。FLUX 3 の訓練では動画予測が計算コストの 95% 以上を占め、モデルは接触・重力・因果関係など物理法則を習得し、その世界モデルを複数の用途に活用可能にした。アクション予測をカリキュラムに追加した初期段階で動画生成品質が最大 10% 低下したが、3,500 ステップで完全に回復し、同一バックボーンで動画生成とロボット制御の両立が実証された。FLUX-mimic は軽量なアクションデコーダを FLUX 3 の中間表現に乗せ、実工場での部品キッティングや生産・物流業務に導入され、業界要件に適応した次世代の汎用マニピュレーションモデルとなった。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。