注目★★★★★Hugging Face Papers
200超の社内アプリを1つのLLMに統合、7倍大モデル超え
30秒で把握
- 1200超の社内アプリを単一LLMへ統合しプラットフォーム通信量の50%を処理
- 2GRPO専門家3種を2段階SLERPで統合し約7倍大きいモデルを性能で上回る
- 3社内Arena 69.6対65.8、月1億1,600万リクエストを低コストで処理
要約
企業向けの自己ホスト型LLMを、200超の社内アプリのリクエストを処理できる単一モデルへ統合した。Instruction following、function-calling、社内タスク分布の3軸ごとにGRPO専門家を別々に学習し、2段階のSLERPで統合した。非推論モードで約7倍大きいベースラインを社内Arenaで69.6対65.8、instruction followingで0.85対0.83、function-callingで0.79対0.77と上回った。モデルは月1億1,600万リクエストを処理し、プラットフォーム通信量の50%を担った。
あなたへの影響
自己ホスト型LLMを運用する日本企業は、実トラフィックに即した評価軸と個別の失敗分析を導入し、次スプリントで単一モデルへの統合効果を検証するとよい。
推奨:GRPOは強化学習手法、SLERPはモデルの重みを補間して統合する手法である。