注目★★★★★Hacker News
Brood War Bench、AI最強Codexも初心者級
30秒で把握
- 1Brood War Benchで全モデル初心者級、Codex Astraが一貫して首位
- 2Grok 4.6は43分で推論11,138トークン、指令6回に停滞
- 3Codexは奇襲に強く、Fableは技術進行と勝利を実現
要約
Brood War Benchでは、全モデルが初心者レベルを超えず、Codex Astraが他モデルを一貫して破って首位になった。Grok 4.6は43分間で推論トークン11,138個を消費し、指令バッチを6回しか出さず戦闘ユニットを投入できなかった。Codexは奇襲攻撃に強い一方、継続的な生産や複数エージェント間の連携に弱く、Fableは経済拡大や技術ツリー進行を試み、勝利した試合もあった。それでも複雑な軍隊の編成や単純な攻撃への防御、具体的な戦略の実行には失敗した。
あなたへの影響
AIエージェントでRTSを自動操作するチームは、勝率だけでなく指令頻度・推論コスト・経済と軍事の連携を個別に計測すべきです。
推奨:長時間の推論が観測と行動の停滞につながり得るため、実運用では低遅延の制御ループを検証する必要があります。