注目★★★★★Hacker News
ローカル LLM が期待より弱く見える理由─推論実装の落とし穴
30秒で把握
- 1ローカル LLM の弱さは Attention バックエンド・量子化・キャッシュ精度の環境差が原因
- 2Qwen 3.6-27B の 100k トークン実験で FlashAttention 2 と Triton が後半でトークン選択で乖離
- 3公開ベンチマークでなく実運用ワークロード (ツール呼び出し・長コンテキスト) で評価し設定を最適化する
要約
ローカルで動かす LLM が低い性能に見える原因を、実装と推論パイプラインの違いに求める技術分析。同じモデルでも GPU・ソフトウェアスタック・Attention バックエンド (FlashAttention 2 / Flash Inference / Triton) の選択で logit 分布が変わり、トークン選択が変動する。Qwen 3.6-27B の 100k トークンコンテキスト実験で、後半部分でバックエンド間の不一致率が増加し、KL Divergence で測定すると有意な差が現れた。量子化・キャッシュ精度・サンプラー設定も含む 734 個のコンポーネントが各々のセットアップで異なり、公開ベンチマークより実運用が重要。
あなたへの影響
自社環境で LLM を運用するエンジニアは、公開ベンチマークスコアを過信せず、実際のワークロード (長コンテキスト・ツール呼び出し) での評価と Attention バックエンド・サンプラー温度の見直しを試す価値がある。
推奨:特に量子化モデルの KLD 値は参照環境の完全開示を確認してから比較すべき。