注目★★★★★GitHub Trending
Heretic、LLMの拒否応答を自動除去
30秒で把握
- 1Heretic がLLMの拒否応答を追加学習なしで自動除去
- 2Optunaで拒否数とKL divergenceを同時最小化し品質を維持
- 3dense・MoE・マルチモーダル対応、5000超のモデルを作成
要約
Heretic は、追加学習なしでTransformerベースの言語モデルから安全性アラインメントによる拒否応答を自動除去するツール。directional ablationとOptunaのTPEベース最適化を組み合わせ、拒否数と元モデルからのKL divergenceを同時に最小化する。人手での設定やTransformer内部の知識は不要で、コマンドライン操作だけで実行できる。大半のdenseモデル、多くのマルチモーダルモデル、複数のMoE構成、一部のハイブリッドモデルに対応し、コミュニティでは5000超のモデルが作成された。純粋なstate-space modelなどは未対応で、Qwen3-4B-Instruct-2507の処理時間はRTX 3090で約20〜30分。
あなたへの影響
LLMの挙動を検証するエンジニアは、生成モデルの安全性・品質・利用規約への適合を確認したうえで、隔離環境で評価する必要がある。
推奨:abliterationはモデル内部の特定方向を抑制する手法で、研究用途でも出力変化とベンチマーク結果の確認が欠かせない。