最重要★★★★★Anthropic
AIモデルの差分検出で未知の危険な挙動を発見
30秒で把握
- 1Anthropicが異種AIモデルの行動差分を検出するDFCを開発
- 2Qwen系のCCP整合、Llamaの米国例外主義、GPT-OSS-20Bの著作権拒否を特定
- 3特徴の抑制・増幅で検証し未知の挙動を監査対象化
要約
Anthropicの研究チームは、異なるアーキテクチャのAIモデルを比較し、新モデル固有の危険な挙動を自動検出する「Dedicated Feature Crosscoder(DFC)」を開発した。DFCは共有特徴と各モデル固有の特徴を分離し、Qwen3-8BとDeepSeek-R1-0528-Qwen3-8Bでは中国共産党への整合、Llama-3.1-8B-Instructでは米国例外主義、GPT-OSS-20Bでは著作権拒否機構を特定した。特徴を抑制・増幅するsteeringで、検出した特徴が検閲や拒否などの挙動を実際に制御することも検証した。CCP整合特徴は5回中5回、米国例外主義は5回中4回再発見された。既存ベンチマークが見逃す未知の挙動を、モデル差分から監査する手法になる。
あなたへの影響
AIモデルを評価・更新する日本の開発チームは、既存ベンチマークだけでなく旧版との差分分析を安全審査に加え、リリース前に固有挙動をsteeringで検証すべきです。
推奨:DFCはモデル内部の特徴を共有部分と固有部分に分ける手法で、原因そのものまでは特定しません。