最重要★★★★★Anthropic
Claudeを16百万回抽出、Anthropicが蒸留攻撃を検知
30秒で把握
- 1Anthropicが3研究所によるClaude抽出を検知、1,600万回超を確認
- 2DeepSeek15万回超、Moonshot340万回超、MiniMax1,300万回超
- 3不正蒸留で安全策流出、検知・アクセス制御・情報共有を強化
要約
Anthropicは、DeepSeek、Moonshot、MiniMaxが約24,000の不正アカウントを使い、Claudeとのやり取り1,600万回超から能力を大規模に抽出したと公表した。3件はClaudeのagentic reasoning、tool use、codingなどを狙い、MiniMaxだけで1,300万回超、Moonshotで340万回超、DeepSeekで15万回超の交換を発生させた。蒸留は強力なモデルの出力で別モデルを訓練する正当な手法だが、違法利用では安全策を欠くモデルの拡散や、輸出管理の実効性を損なうリスクがある。Anthropicは検知分類器、行動指紋、アクセス制御、出力への対策を強化し、AI企業やクラウド事業者、政策当局との情報共有を進める。
あなたへの影響
Claudeや他社のfrontier modelをAPI経由で利用する日本の開発チームは、異常な大量アクセスや不正アカウント利用を監視し、利用規約とアクセス経路を近日中に再確認すべき。
推奨:蒸留攻撃は正当なモデル圧縮と区別しにくいため、反復的なプロンプト集中を検知する監査設計につながり得る。