注目★★★★★Hugging Face Papers
2M トークンの強化学習を固定GPU予算で実現、LongStraw登場
30秒で把握
- 1LongStraw が RL のコンテキスト限界を突破、8H20 GPU で 2.1M トークン対応・メモリ効率と計算容量の両立
- 2推論の 100 万トークン超と RL 256K 以下のギャップ解消、エージェント学習の長期軌跡蓄積に直結
- 3GRPO と選別状態の逐次リプレイで GPU 予算固定化、32 GPU での全層実行確認で実用性を証明
要約
推論は100万トークン超のコンテキストに対応する一方、強化学習は256Kトークン以下に留まる課題を解く LongStraw が発表された。Group Relative Policy Optimization (GRPO) ベースの実行スタック で、共有プロンプト評価に自動微分を使わず、後続トークン向け状態を選別し、応答ブランチを逐次リプレイして活メモリを削減する。8枚の H20 GPU で Qwen3.6-27B (ハイブリッド再帰型) と GLM-5.2 (圧縮注意 MoE) の実装を完了、スコアリングと逆伝播で 2.1M 位置まで対応し、グループサイズ増加時にメモリ追加は 0.21GB に抑制した。32枚 GPU での実験では GLM-5.2 全 78 層を通じた 2.1M トークンプロンプトの実行確認を達成した。
あなたへの影響
この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。
クレカ不要・いつでも解約