Asayomu Tech
注目★★★★★Hacker News

Brood War Bench、AI最強Codexも初心者級

30秒で把握

  • 1Brood War Benchで全モデル初心者級、Codex Astraが一貫して首位
  • 2Grok 4.6は43分で推論11,138トークン、指令6回に停滞
  • 3Codexは奇襲に強く、Fableは技術進行と勝利を実現

要約

Brood War Benchでは、全モデルが初心者レベルを超えず、Codex Astraが他モデルを一貫して破って首位になった。Grok 4.6は43分間で推論トークン11,138個を消費し、指令バッチを6回しか出さず戦闘ユニットを投入できなかった。Codexは奇襲攻撃に強い一方、継続的な生産や複数エージェント間の連携に弱く、Fableは経済拡大や技術ツリー進行を試み、勝利した試合もあった。それでも複雑な軍隊の編成や単純な攻撃への防御、具体的な戦略の実行には失敗した。

あなたへの影響

AIエージェントでRTSを自動操作するチームは、勝率だけでなく指令頻度・推論コスト・経済と軍事の連携を個別に計測すべきです。

推奨:長時間の推論が観測と行動の停滞につながり得るため、実運用では低遅延の制御ループを検証する必要があります。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。