注目★★★★★Hugging Face Papers
マルチエージェントLLMの反省を理論化、SRMAでSWE-bench解決率72.2%
30秒で把握
- 1マルチエージェントLLMを二層協調ゲームとして定式化
- 2SRMAが環境評価リスク低下時だけメモリを採用
- 3500件のSWE-benchで72.2%、mini-SWE-agentは70.8%
要約
本論文は、オーケストレーターとワーカーで構成するマルチエージェントLLMを、二層協調ゲームと確率的な意味メモリ更新として定式化した。タスク分解の質がワーカー間ゲームの均衡ずれを左右し、生成テキストだけを見る評価ゲートは、テキスト上区別できない環境で一様な改善を保証できないと証明した。そこで、環境に基づく評価リスクが厳密に下がる場合だけ候補メモリを採用するSRMAを導入し、幾何的または多項式的な収束保証を示した。500件のSWE-benchで、Kimiベースのシステムは72.2%を解決し、公開版mini-SWE-agentの70.8%を上回った。
あなたへの影響
マルチエージェントLLMを開発・評価するチームは、テキスト内の自己評価だけでなく実行環境に基づく評価ゲートを設計し、次の検証でSRMA型のメモリ更新を比較してください。
推奨:SWE-benchの差は参考値であり、実運用では対象タスクと評価環境を揃えた再現検証が必要です。