注目★★★★★Hugging Face Papers
AIエージェント、SAE解釈研究で専門家に届かず
30秒で把握
- 1SAEScientist-BenchがAIエージェントのSAE特徴発見能力を評価
- 2Gemma-2-9B-ITで13万1,000超の特徴を10構成・20タスクで検証
- 3対照概念の選別は前進も因果的生成ステアリングは専門家に大幅未達
要約
SAEScientist-Benchは、AIエージェントがSparse Autoencoder(SAE)を使ってモデル内部の特徴を自律発見できるか評価するベンチマークだ。Gemma-2-9B-ITのGemma Scopeにある13万1,000超の特徴から、エージェントが対照プローブを設計して標的概念に最適な特徴を探す。10構成・20タスクでは有望な特徴を発見し、対照概念との選別で専門家水準に近づいた一方、因果的な生成ステアリングでは大きく遅れた。エージェントは候補の除外には成功するが、実験測定を頻繁に誤解釈した。
あなたへの影響
モデル監査や解釈可能性を扱う日本のエンジニアは、SAEを使う自律研究エージェントの評価で、特徴発見と因果的ステアリングを分けて検証すべき。
推奨:測定値の誤解釈が起こり得るため、実験結果の人手確認を含む評価設計が必要になる。