Asayomu Tech
注目★★★★Hugging Face Papers

2M トークンの強化学習を固定GPU予算で実現、LongStraw登場

30秒で把握

  • 1LongStraw が RL のコンテキスト限界を突破、8H20 GPU で 2.1M トークン対応・メモリ効率と計算容量の両立
  • 2推論の 100 万トークン超と RL 256K 以下のギャップ解消、エージェント学習の長期軌跡蓄積に直結
  • 3GRPO と選別状態の逐次リプレイで GPU 予算固定化、32 GPU での全層実行確認で実用性を証明

要約

推論は100万トークン超のコンテキストに対応する一方、強化学習は256Kトークン以下に留まる課題を解く LongStraw が発表された。Group Relative Policy Optimization (GRPO) ベースの実行スタック で、共有プロンプト評価に自動微分を使わず、後続トークン向け状態を選別し、応答ブランチを逐次リプレイして活メモリを削減する。8枚の H20 GPU で Qwen3.6-27B (ハイブリッド再帰型) と GLM-5.2 (圧縮注意 MoE) の実装を完了、スコアリングと逆伝播で 2.1M 位置まで対応し、グループサイズ増加時にメモリ追加は 0.21GB に抑制した。32枚 GPU での実験では GLM-5.2 全 78 層を通じた 2.1M トークンプロンプトの実行確認を達成した。

あなたへの影響

この記事が日本のエンジニアに与える影響と、今日取るべきアクションは、Personal会員向けに掲載しています。

7日間無料で読む

クレカ不要・いつでも解約

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。