Asayomu Tech
最重要★★★★★Anthropic

LLMの長文入力で安全策を突破、攻撃成功率61%→2%

30秒で把握

  • 1Anthropicがmany-shot jailbreakingを報告、最大256件の偽対話で安全策を突破
  • 2自社・他社モデルで有効、入力分類と修正で成功率61%から2%へ低下
  • 3コンテキスト長の拡大が新たなLLM攻撃面となり対策が必要

要約

Anthropicは、LLMの安全策を長大な入力で回避する「many-shot jailbreaking」を報告した。この手法は、危険な質問に答える偽の対話を最大256件並べ、最後に標的質問を置くことで、モデルに有害な回答を生成させる。Anthropic製モデルだけでなく他社モデルにも有効で、コンテキスト長の拡大に伴って成功率が高まった。単純な拒否訓練では攻撃を遅らせるだけだったが、入力の分類・修正による対策で、攻撃成功率を61%から2%へ低下させた。

あなたへの影響

LLMを本番利用する日本の開発チームは、長大なプロンプトを受け付ける機能で安全評価と入力監視を実施し、対策済みモデルやプロンプト防御の有効性を近日中に検証すべきです。

推奨:many-shot jailbreakingは、偽の対話例を大量に含めてモデルのin-context learningを悪用する攻撃です。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。