注目★★★★★Hugging Face Papers
LLMは曖昧な目標から自己進化できるか、ASPIREで検証
30秒で把握
- 1ASPIREが曖昧な目標だけでLLM自己進化を評価する基準を導入
- 2520項目・6目標の隠れた評価で学習とハーネス編集を検証
- 3重み更新は少なく不安定でQwen-Agent基準を下回った
要約
ASPIREは、自然言語の曖昧な能力目標だけでLLMエージェントが自己進化できるかを測るベンチマークだ。評価タスクを隠した環境で、エージェントはデータや更新方法、学習・検証信号、評価時期を自ら決める。520項目・6目標の評価で、学習やエージェント基盤の編集ループは完了したが、重み更新による改善は少なく不安定だった。最も強い進化後のハーネスも、設計済みのQwen-Agent基準を下回った。データの目標不一致や狭い自己評価により、局所的な改善が隠れた評価へ移らず、継続学習で以前の改善が失われた。
あなたへの影響
LLMエージェントの研究チームは、明示的なタスク評価だけでなく、目標解釈・データ選択・隠れた評価への転移を含む自己進化性能を近日中に検証したい。
推奨:自己評価が狭いままだと改善が消える可能性があるため、独立した検証セットと学習履歴の比較を組み込むべきだ。