Asayomu Tech
注目★★★★Hugging Face Papers

T1、122B MoEで端末タスク成功率64.0%

30秒で把握

  • 1T1が122B MoEと強化学習で長期端末タスクを実行
  • 2Terminal-Bench 2.1の成功率を43.8%から64.0%へ改善
  • 3Long-Horizon Terminal Benchで27.9%、GPT-5.4とGLM-5.1超え

要約

T1は、122B規模のMixture-of-Expertsモデルを強化学習で訓練し、クラウドサンドボックス上の実シェルで長期の端末タスクを実行する。1タスク最大300回超のツール呼び出しに対応し、各タスク固有の検証器の実行結果を報酬に使う。TITOとR3により訓練時と推論時の対数確率差を0.021から0.013へ縮小し、損失計算領域ではトークンずれをゼロに揃えた。Terminal-Bench 2.1では初期モデルの43.8%から64.0%へ改善し、Long-Horizon Terminal Benchでは27.9%を達成してGPT-5.4とGLM-5.1を上回った。

あなたへの影響

長時間のCLI操作を自動化する日本の開発チームは、Terminal-Bench 2.1だけでなく自社検証器による長期タスク評価を次スプリントで実施すべきです。

推奨:実行結果を検証器で採点する強化学習は、単発応答では測れないエージェント性能を評価する手法です。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。