最重要★★★★★Hugging Face Papers
OpenAI・Anthropic・Google の推論ログから機密情報を盗み出す攻撃手法、研究者が実証
30秒で把握
- 1OpenAI・Anthropic・Google の暗号化推論トレスが異セッション間で互換・弱いモデルへの注入で復号可能
- 231.5 万個のログ解析で 367 個 PII・182 個認証情報を抽出・蒸留防止機構も回避可能
- 3クライアント側ログの公開共有リスク・暗号化設計の多層防御強化・ API ドキュメントの明確化が必要
要約
研究者は OpenAI・Anthropic・Google が返すクライアントの暗号化推論ログ (CoT トレース) に重大な脆弱性を発見した。異なるセッション・ユーザー・モデル間で暗号化ブロックが互換性を持つため、より弱いモデルに強いモデルの暗号化ログを注入すると、そのモデルが復号して平文で出力してしまう。この脆弱性により、蒸留防止機構の回避・大規模な非公開データ抽出・隠蔽情報の露出の 3 つの攻撃が可能になる。
あなたへの影響
暗号化推論ログはクライアント側に保存される前提で設計されているため、トークン化・セッション固定化・レート制限強化などの多層防御が急務。
推奨:自社 API を使うチームは、公開リポジトリへのセッションログ共有を直ちに見直し、既存ログの監査と削除を検討すべき。