Asayomu Tech
注目★★★★Hugging Face Papers

OpenWebRL: 視覚的 Web エージェントをオンライン RL で訓練するオープンフレームワーク

要約

OpenWebRL は、実際のウェブサイト上でビジュアル Web エージェントをオンライン多段強化学習(RL)で訓練するオープンフレームワークです。スケーラブルなライブブラウザ基盤、軌跡レベルの成功判定、効率的な多段ポリシー最適化など訓練パイプライン全体をカバーしています。このフレームワークで学習した 4B パラメータモデル OpenWebRL-4B は、わずか 0.4K の初期化軌跡と 2.2K の RL タスクで、Online-Mind2Web で 67.0%、DeepShop で 64.0% の成功率を達成し、OpenAI CUA や Gemini CUA といったプロプライエタリシステムとも競合する性能を示しました。

あなたへの影響

Web エージェント研究に取り組むチームにとって、少量データでプロプライエタリ水準に迫るオープン手法の登場は注目すべき進展です。

推奨:次のスプリントでアーキテクチャ設計やベンチマーク比較の参考として評価することを推奨します。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。