Asayomu Tech
注目★★★★Hugging Face Papers

LLMは曖昧な目標から自己進化できるか、ASPIREで検証

30秒で把握

  • 1ASPIREが曖昧な目標だけでLLM自己進化を評価する基準を導入
  • 2520項目・6目標の隠れた評価で学習とハーネス編集を検証
  • 3重み更新は少なく不安定でQwen-Agent基準を下回った

要約

ASPIREは、自然言語の曖昧な能力目標だけでLLMエージェントが自己進化できるかを測るベンチマークだ。評価タスクを隠した環境で、エージェントはデータや更新方法、学習・検証信号、評価時期を自ら決める。520項目・6目標の評価で、学習やエージェント基盤の編集ループは完了したが、重み更新による改善は少なく不安定だった。最も強い進化後のハーネスも、設計済みのQwen-Agent基準を下回った。データの目標不一致や狭い自己評価により、局所的な改善が隠れた評価へ移らず、継続学習で以前の改善が失われた。

あなたへの影響

LLMエージェントの研究チームは、明示的なタスク評価だけでなく、目標解釈・データ選択・隠れた評価への転移を含む自己進化性能を近日中に検証したい。

推奨:自己評価が狭いままだと改善が消える可能性があるため、独立した検証セットと学習履歴の比較を組み込むべきだ。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。