Asayomu Tech
注目★★★★Hugging Face Papers

プロンプト注入攻撃を 9% まで抑制、トークン単位での防御学習 SecOPD

30秒で把握

  • 1SecOPD がトークン単位フィードバックで適応的プロンプト注入対策を実現、Qwen 27B が 94% から 9% に攻撃成功率を削減
  • 2訓練未使用ドメインへも防御が一般化、ツール呼び出しで 4.7% ASR を達成・Meta-SecAlign 比で大幅改善
  • 3GitHub・HuggingFace で公開済みのモデル・コードを自社 RAG/エージェント環境で防御評価・ベンチマーク化すべき

要約

プロンプト注入は AI エージェント最大の脅威であり、既存防御手法は適応的な攻撃に対して 94% 近い成功率を許している。本論文は Secure On-Policy Distillation (SecOPD) を提案し、従来の文字列全体に対するフィードバックではなくトークン単位での細粒度フィードバック信号を用いて防御微調整を行う。Qwen3.6-27B を SecOPD で防御したモデルは、SoTA 攻撃 (PISmith) に対して 9.0% の攻撃成功率を実現し、従来手法 Meta-SecAlign の 94.0% から大幅に改善した。この防御は訓練に使わなかったドメイン (エージェントのツール呼び出しなど) にも一般化し、4.7% の成功率を達成した。

あなたへの影響

プロンプト注入への耐性が必須となる RAG・エージェントシステムの開発チームは、トークン単位フィードバックの利点を理解した上で同論文のモデル・コードを評価対象に含め。

推奨:次スプリントでのセキュリティベンチマーク再実施を検討する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。