注目★★★★★Hugging Face Papers
SearchSwarm-30B:長期タスク向け委任知能でBrowseComp 68.1達成
30秒で把握
- 1SearchSwarm-30B-A3BがBrowseComp 68.1・ZH 73.3で同規模最高を達成
- 2ハーネス誘導トラジェクトリをSFTデータ化し委任知能をモデルに内在化
- 3長期タスク向け委任学習データ合成手法をOSSコミュニティ初公開予定
要約
LLMがコンテキスト上限に縛られる長期タスクを解決するため、メインエージェントがサブタスクを分解・委任し結果のみを受け取る「委任知能」の研究が発表された。研究チームはハーネス誘導によりモデルに高品質な委任決定を学習させ、そのトラジェクトリをSFTデータとして活用した。得られたモデルSearchSwarm-30B-A3BはBrowseCompで68.1、BrowseComp-ZHで73.3を達成し、同規模モデル中最高スコアを記録した。
あなたへの影響
マルチエージェント構成でRAGや深いリサーチタスクを開発しているチームは、委任判断をSFTで内在化するこのアプローチをベースラインとして評価する価値がある。
推奨:モデルとデータのリリースが予告されているため、公開後に自社タスクでのベンチマーク比較を次スプリントで計画しておくと良い。