Asayomu Tech
注目★★★★Hugging Face Papers

LLMの自信を過去経験から推定、XConfが24比較中23で優位

30秒で把握

  • 1XConfがLLMの信頼度を過去経験から推定し24比較中23回で優位
  • 29ベンチマーク・4モデルで評価し生成コストを10分の1に削減
  • 3低信頼度10%の棄却でエージェント成功率が最大8.7ポイント向上

要約

研究チームは、LLMの信頼度を現在の推論だけでなく、過去の成功・失敗経験から推定するXConfを提案した。XConfは類似タスクの記録から過去の成功率を検索し、失敗パターンを振り返って信頼度を再評価する。ロジット参照や重み更新は不要で、生成は1回 בלבדで済む。推論・コード・マルチモーダルQA・対話エージェントの9ベンチマークで、4モデルを評価した結果、10回生成するself-consistencyをAUROCで24比較中23回上回るか同等となり、生成コストは10分の1だった。信頼度が低い10%を棄却すると、エージェント課題の成功率が最大8.7ポイント向上した。

あなたへの影響

LLMを選択的予測や自動エスカレーションに使う日本の開発チームは、既存の信頼度推定とXConfの精度・コストを次スプリントで比較検証するとよい。

推奨:過去エピソードの記録を参照して信頼度を補正する方式のため、評価データの保存方法と再利用範囲の設計も必要になる可能性がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。