注目★★★★★Hugging Face Papers
Agent Lightning v1.0、エージェント学習を実戦環境に統合—Qwen3.5でSWE-benchが41.8%→56.4%に
30秒で把握
- 1Hugging Face が Agent Lightning v1.0 公開・エージェントハーネスを RL 学習に統合
- 2Qwen3.5-9B が SWE-bench Verified で 14.6 ポイント向上 (41.8%→56.4%)・6K 事例で達成
- 3再現可能パイプル公開・本番エージェントの効率的な能力向上を検証可能に
要約
Hugging Face は Agent Lightning v1.0 を公開し、デプロイ環境のエージェント・ハーネスをRL学習に直結させる「harnessed agentic RL」の実装フレームワークを示した。従来のRL手法と異なり、ハーネスが環境とのやり取りを支配し、トレーナーはLLMのリクエスト-レスポンス列のみ観測する設計で、再トークン化・サンプル統合・勾配計算の課題を扱う。わずか6K事例と限定計算量で、Qwen3.5-9B を SWE-bench Verified で 41.8% から 56.4% に改善し、14.6ポイント絶対向上を達成した。フレームワークは約3,500行のコードで実装され、命令追従・検索・コーディングエージェントで評価でき、完全な再現パイプラインを公開している。
あなたへの影響
SWE-benchのような実務的なコーディングタスクで 14.6 ポイント向上は、小規模モデルの能力拡張に現実的な手段が得られたことを示している。
推奨:自社運用エージェントをRL微調整する際のプラクティスや制約条件が明確になるため、実装検討チームはこのフレームワークを評価対象に加えるべき。