注目★★★★★Hugging Face Papers
T1、122B MoEで端末タスク成功率64.0%
30秒で把握
- 1T1が122B MoEと強化学習で長期端末タスクを実行
- 2Terminal-Bench 2.1の成功率を43.8%から64.0%へ改善
- 3Long-Horizon Terminal Benchで27.9%、GPT-5.4とGLM-5.1超え
要約
T1は、122B規模のMixture-of-Expertsモデルを強化学習で訓練し、クラウドサンドボックス上の実シェルで長期の端末タスクを実行する。1タスク最大300回超のツール呼び出しに対応し、各タスク固有の検証器の実行結果を報酬に使う。TITOとR3により訓練時と推論時の対数確率差を0.021から0.013へ縮小し、損失計算領域ではトークンずれをゼロに揃えた。Terminal-Bench 2.1では初期モデルの43.8%から64.0%へ改善し、Long-Horizon Terminal Benchでは27.9%を達成してGPT-5.4とGLM-5.1を上回った。
あなたへの影響
長時間のCLI操作を自動化する日本の開発チームは、Terminal-Bench 2.1だけでなく自社検証器による長期タスク評価を次スプリントで実施すべきです。
推奨:実行結果を検証器で採点する強化学習は、単発応答では測れないエージェント性能を評価する手法です。