Asayomu Tech
注目★★★★Hugging Face Papers

ターミナルAIの長期タスク学習データ、合成で大量生成 約0.05ドル/タスク

30秒で把握

  • 1RST フレームワークで 15 ラウンドを通じて 37,484 ターミナルエージェントタスクを自動生成、コスト約 0.05 ドル/タスク
  • 2参照ソリューション 67 行→374 行、実行コマンド数 40→244 に段階的上昇、難易度制御を実現
  • 3Qwen3.5 モデル微調整で Terminal-Bench 最大 10 ポイント改善、PPO 強化学習で 27B は 49.44% 達成

要約

研究チームが Recursive Synthetic Terminal Tasks (RST) という枠組みを開発し、長期ホライズンのターミナルエージェント向け学習タスクを自動生成した。検証済みシードタスクから始まり、参照ソリューション・検証機・指示文を整合させながら再帰的に拡張し、15 ラウンドで 37,484 タスクを約 0.05 ドル/タスクで生成した。難易度は各ラウンドで上昇し、参照ソリューションは 67 行から 374 行へ、実行コマンド数は 40 から 244 へ増加し、DeepSeek-V4-Pro の成功率は初期 90% から最終 2.5% へ低下した。生成タスクで Qwen3.5 モデルを微調整すると、Terminal-Bench 系複数ベンチマークで最大 10 ポイント向上し、PPO による強化学習では Qwen3.5-27B が 49.44% に到達した。

あなたへの影響

ターミナルエージェント・CLIツール自動化の商用学習モデル構築を考えるチームは。

推奨:生成・検証・難易度制御の枠組みとしてRSTのアプローチを参考に、社内タスクデータセットの自動拡張ワークフロー設計を検討する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。