Asayomu Tech
注目★★★★★GitHub Trending

Heretic、LLMの拒否応答を自動除去

30秒で把握

  • 1Heretic がLLMの拒否応答を追加学習なしで自動除去
  • 2Optunaで拒否数とKL divergenceを同時最小化し品質を維持
  • 3dense・MoE・マルチモーダル対応、5000超のモデルを作成

要約

Heretic は、追加学習なしでTransformerベースの言語モデルから安全性アラインメントによる拒否応答を自動除去するツール。directional ablationとOptunaのTPEベース最適化を組み合わせ、拒否数と元モデルからのKL divergenceを同時に最小化する。人手での設定やTransformer内部の知識は不要で、コマンドライン操作だけで実行できる。大半のdenseモデル、多くのマルチモーダルモデル、複数のMoE構成、一部のハイブリッドモデルに対応し、コミュニティでは5000超のモデルが作成された。純粋なstate-space modelなどは未対応で、Qwen3-4B-Instruct-2507の処理時間はRTX 3090で約20〜30分。

あなたへの影響

LLMの挙動を検証するエンジニアは、生成モデルの安全性・品質・利用規約への適合を確認したうえで、隔離環境で評価する必要がある。

推奨:abliterationはモデル内部の特定方向を抑制する手法で、研究用途でも出力変化とベンチマーク結果の確認が欠かせない。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。