Asayomu Tech
注目★★★★★Hugging Face Blog

TRLとOpenEnvで水彩画を描くCoding Modelを訓練

30秒で把握

  • 1TRLとOpenEnvで水彩画を描くCoding Modelの訓練を公開
  • 2p5.brushの10メソッドと178枚の手評価画像を報酬に使用
  • 3判定モデル追加でpaint coverageが0.11から最大0.30へ増加

要約

著者はTRLとOpenEnvを使い、JavaScriptで水彩画を描くCoding Modelの訓練パイプラインをオープン実装した。p5.brushの47メソッドから10メソッドだけを許可し、HPSv3と人手評価を反映したQwen3-VL-30B-A3B-Instructの2種類の報酬でGRPOを実行した。178枚の手評価画像を参照プールに使い、HPSv3単独と2種類の報酬混合を比較した。判定モデルを加えた実験では、paint coverageが0.11から0.23、または0.13から0.30へ倍増した。訓練は単一の花を集めたプールに似た出力へ収束し、多様性には報酬プールの設計が必要になった。

あなたへの影響

生成AIの実験やRL基盤を扱う日本のエンジニアは、公開された環境・モデル・データセットを使って小規模な再現実験を検討できる。

推奨:評価対象を人手で選ぶ設計が出力の品質と多様性を左右し得るため、報酬データの偏りとインフラ障害によるノイズを分けて検証する必要がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。