注目★★★★★Hugging Face Blog
TRLとOpenEnvで水彩画を描くCoding Modelを訓練
30秒で把握
- 1TRLとOpenEnvで水彩画を描くCoding Modelの訓練を公開
- 2p5.brushの10メソッドと178枚の手評価画像を報酬に使用
- 3判定モデル追加でpaint coverageが0.11から最大0.30へ増加
要約
著者はTRLとOpenEnvを使い、JavaScriptで水彩画を描くCoding Modelの訓練パイプラインをオープン実装した。p5.brushの47メソッドから10メソッドだけを許可し、HPSv3と人手評価を反映したQwen3-VL-30B-A3B-Instructの2種類の報酬でGRPOを実行した。178枚の手評価画像を参照プールに使い、HPSv3単独と2種類の報酬混合を比較した。判定モデルを加えた実験では、paint coverageが0.11から0.23、または0.13から0.30へ倍増した。訓練は単一の花を集めたプールに似た出力へ収束し、多様性には報酬プールの設計が必要になった。
あなたへの影響
生成AIの実験やRL基盤を扱う日本のエンジニアは、公開された環境・モデル・データセットを使って小規模な再現実験を検討できる。
推奨:評価対象を人手で選ぶ設計が出力の品質と多様性を左右し得るため、報酬データの偏りとインフラ障害によるノイズを分けて検証する必要がある。