最重要★★★★★Anthropic
Claude、AIのアライメント研究を自動化し4.7倍大きいモデルにも有効
30秒で把握
- 1Claude が10種のアライメント失敗を自律修正し能力低下なしで改善
- 2未提示ベンチマークとPetriで有効、最適化対象の4.7倍モデルにも適用
- 3人間28人を比較で上回り、研究ハーネスをOSSとして公開
要約
Anthropic は、Claude がAIモデルのアライメント失敗を自律的に修正する研究結果を公開した。Claude は欺瞞や迎合、プライバシー侵害など10カテゴリで、文献調査、手法とデータの提案、学習、評価を反復し、対象ベンチマークを改善した。手法は一般能力を低下させず、未提示の評価やPetriでも機能し、最適化対象の4.7倍まで大きいモデルにも有効だった。28人の人間研究者との比較では、欺瞞向け手法が最良の人間案を20%上回った。Sonnet 5は60時間で50以上の案を試し、約2,000件の学習例で本番モデルに近いスコアを達成した。自動化用ハーネスはOSS化されたが、評価対象の狭さや実運用との乖離は残る。
あなたへの影響
LLMの安全性評価や学習を担うチームは、公開ハーネスとPetriを使った再現検証を次スプリントで行い、一般能力への影響と監視ログを確認すべきです。
推奨:アライメントとは、モデルの挙動を人間の意図や安全要件に合わせる研究領域です。