注目★★★★★Hugging Face Papers
2M トークンの強化学習を固定GPU予算で実現、LongStraw登場
30秒で把握
- 1LongStraw が RL のコンテキスト限界を突破、8H20 GPU で 2.1M トークン対応・メモリ効率と計算容量の両立
- 2推論の 100 万トークン超と RL 256K 以下のギャップ解消、エージェント学習の長期軌跡蓄積に直結
- 3GRPO と選別状態の逐次リプレイで GPU 予算固定化、32 GPU での全層実行確認で実用性を証明
要約
推論は100万トークン超のコンテキストに対応する一方、強化学習は256Kトークン以下に留まる課題を解く LongStraw が発表された。Group Relative Policy Optimization (GRPO) ベースの実行スタック で、共有プロンプト評価に自動微分を使わず、後続トークン向け状態を選別し、応答ブランチを逐次リプレイして活メモリを削減する。8枚の H20 GPU で Qwen3.6-27B (ハイブリッド再帰型) と GLM-5.2 (圧縮注意 MoE) の実装を完了、スコアリングと逆伝播で 2.1M 位置まで対応し、グループサイズ増加時にメモリ追加は 0.21GB に抑制した。32枚 GPU での実験では GLM-5.2 全 78 層を通じた 2.1M トークンプロンプトの実行確認を達成した。
あなたへの影響
強化学習によるモデル改善を長いコンテキスト(エージェントの軌跡蓄積を含む)で行う場合、メモリ効率の工夫が本手法により現実的になる可能性がある。
推奨:自社で大規模言語モデルの RL 改善を検討しているチームは、メモリ構成と学習スケール計画の再評価を検討する価値がある。