注目★★★★★Hugging Face Papers
StateM: 実行環境の最適化で GPT-5.6 が 95.3% 精度達成、ターミナルベンチで検証
30秒で把握
- 1StateM が Terminal-Bench 2.1 で GPT-5.6 Sol xhigh 95.3% 精度達成・状態永続化と手順管理で 長時間エージェント実行を安定化
- 2同ランタイムでDeepSeek-V4 Flash を 82.7% から 88.1% へ改善・API コスト $574.68 から $15 に削減
- 3エージェント実装チームは状態管理と手順の版管理によるモデル非依存の精度向上の手法を検証
要約
Hugging Face の研究チームが StateM を発表した。これは長時間実行が必要なタスクでモデルのウェイト変更なしに精度を向上させるエージェント向けランタイムだ。Terminal-Bench 2.1 で GPT-5.6 Sol xhigh が 95.3% の精度を達成し、GPT-5.5 xhigh の 92.1% から大幅に改善した。実装は状態の永続化・フェーズごとのコンテキスト管理・手順書の版管理により、ユーザーとエージェントが検証可能な形で実行を構造化している。DeepSeek-V4 Flash でも同じランタイムとルールセットで 82.7% から 88.1% へ改善し、GPU コスト ($15) は GPT-5.6 リファレンス ($574.68) の 3% 以下に削減された。
あなたへの影響
エージェントシステムの実装チームは、モデル推論の精度だけでは実務運用が成立しない問題—状態喪失・前のステップの記憶消失・手順スキップ等—に直面している。
推奨:StateM のような実行環境の構造化は、既存の強力なモデル(GPT/DeepSeek)をそのまま使いながら精度と コスト効率を大幅に改善できる実装パターンとして参考になる。