最重要★★★★★Anthropic
LLMの長文入力で安全策を突破、攻撃成功率61%→2%
30秒で把握
- 1Anthropicがmany-shot jailbreakingを報告、最大256件の偽対話で安全策を突破
- 2自社・他社モデルで有効、入力分類と修正で成功率61%から2%へ低下
- 3コンテキスト長の拡大が新たなLLM攻撃面となり対策が必要
要約
Anthropicは、LLMの安全策を長大な入力で回避する「many-shot jailbreaking」を報告した。この手法は、危険な質問に答える偽の対話を最大256件並べ、最後に標的質問を置くことで、モデルに有害な回答を生成させる。Anthropic製モデルだけでなく他社モデルにも有効で、コンテキスト長の拡大に伴って成功率が高まった。単純な拒否訓練では攻撃を遅らせるだけだったが、入力の分類・修正による対策で、攻撃成功率を61%から2%へ低下させた。
あなたへの影響
LLMを本番利用する日本の開発チームは、長大なプロンプトを受け付ける機能で安全評価と入力監視を実施し、対策済みモデルやプロンプト防御の有効性を近日中に検証すべきです。
推奨:many-shot jailbreakingは、偽の対話例を大量に含めてモデルのin-context learningを悪用する攻撃です。