Asayomu Tech
注目★★★★Hugging Face Papers

マルチエージェントLLMの反省を理論化、SRMAでSWE-bench解決率72.2%

30秒で把握

  • 1マルチエージェントLLMを二層協調ゲームとして定式化
  • 2SRMAが環境評価リスク低下時だけメモリを採用
  • 3500件のSWE-benchで72.2%、mini-SWE-agentは70.8%

要約

本論文は、オーケストレーターとワーカーで構成するマルチエージェントLLMを、二層協調ゲームと確率的な意味メモリ更新として定式化した。タスク分解の質がワーカー間ゲームの均衡ずれを左右し、生成テキストだけを見る評価ゲートは、テキスト上区別できない環境で一様な改善を保証できないと証明した。そこで、環境に基づく評価リスクが厳密に下がる場合だけ候補メモリを採用するSRMAを導入し、幾何的または多項式的な収束保証を示した。500件のSWE-benchで、Kimiベースのシステムは72.2%を解決し、公開版mini-SWE-agentの70.8%を上回った。

あなたへの影響

マルチエージェントLLMを開発・評価するチームは、テキスト内の自己評価だけでなく実行環境に基づく評価ゲートを設計し、次の検証でSRMA型のメモリ更新を比較してください。

推奨:SWE-benchの差は参考値であり、実運用では対象タスクと評価環境を揃えた再現検証が必要です。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。