注目★★★★★Hugging Face Papers
プロンプト注入攻撃を 9% まで抑制、トークン単位での防御学習 SecOPD
30秒で把握
- 1SecOPD がトークン単位フィードバックで適応的プロンプト注入対策を実現、Qwen 27B が 94% から 9% に攻撃成功率を削減
- 2訓練未使用ドメインへも防御が一般化、ツール呼び出しで 4.7% ASR を達成・Meta-SecAlign 比で大幅改善
- 3GitHub・HuggingFace で公開済みのモデル・コードを自社 RAG/エージェント環境で防御評価・ベンチマーク化すべき
要約
プロンプト注入は AI エージェント最大の脅威であり、既存防御手法は適応的な攻撃に対して 94% 近い成功率を許している。本論文は Secure On-Policy Distillation (SecOPD) を提案し、従来の文字列全体に対するフィードバックではなくトークン単位での細粒度フィードバック信号を用いて防御微調整を行う。Qwen3.6-27B を SecOPD で防御したモデルは、SoTA 攻撃 (PISmith) に対して 9.0% の攻撃成功率を実現し、従来手法 Meta-SecAlign の 94.0% から大幅に改善した。この防御は訓練に使わなかったドメイン (エージェントのツール呼び出しなど) にも一般化し、4.7% の成功率を達成した。
あなたへの影響
プロンプト注入への耐性が必須となる RAG・エージェントシステムの開発チームは、トークン単位フィードバックの利点を理解した上で同論文のモデル・コードを評価対象に含め。
推奨:次スプリントでのセキュリティベンチマーク再実施を検討する価値がある。