注目★★★★★Hugging Face Papers
LLMの自信を過去経験から推定、XConfが24比較中23で優位
30秒で把握
- 1XConfがLLMの信頼度を過去経験から推定し24比較中23回で優位
- 29ベンチマーク・4モデルで評価し生成コストを10分の1に削減
- 3低信頼度10%の棄却でエージェント成功率が最大8.7ポイント向上
要約
研究チームは、LLMの信頼度を現在の推論だけでなく、過去の成功・失敗経験から推定するXConfを提案した。XConfは類似タスクの記録から過去の成功率を検索し、失敗パターンを振り返って信頼度を再評価する。ロジット参照や重み更新は不要で、生成は1回 בלבדで済む。推論・コード・マルチモーダルQA・対話エージェントの9ベンチマークで、4モデルを評価した結果、10回生成するself-consistencyをAUROCで24比較中23回上回るか同等となり、生成コストは10分の1だった。信頼度が低い10%を棄却すると、エージェント課題の成功率が最大8.7ポイント向上した。
あなたへの影響
LLMを選択的予測や自動エスカレーションに使う日本の開発チームは、既存の信頼度推定とXConfの精度・コストを次スプリントで比較検証するとよい。
推奨:過去エピソードの記録を参照して信頼度を補正する方式のため、評価データの保存方法と再利用範囲の設計も必要になる可能性がある。