注目★★★★★Hugging Face Papers
知識と推論を分離した Mobius アーキテクチャ、学習データ 63% 減で同等性能を実現
30秒で把握
- 1Memory (知識) と Reasoner (推論) を分離する Mobius-v0 アーキテクチャで知識圧縮と推論効率を改善
- 27B モデルでベースライン比 62.6% の学習データで同等性能達成、35B 継続学習モデルは推論速度 4 倍高速化
- 3学習コスト削減と推論エンドツーエンド速度改善の実装を論文で公開、実運用への適用検討推奨
要約
Mobius-v0 は知識ベクトルを格納するグローバル Memory (FFN) と反復推論を行う複数の Reasoner (Self-Attn) を分離したアーキテクチャを提案する。Reasoner が隠れ状態をキャッシュ・キャリアとして利用しながら Memory に繰り返しクエリを送り、必要な知識ベクトルを取得・推論に活用する。知識と推論の分離により知識圧縮効率と推論速度を改善した。7B モデルをゼロから学習した場合、ベースライン Transformer と同等の下流タスク性能を Transformer 学習データの 62.6% で達成。Qwen3.5-35B から継続事前学習した Intern-S2-Mobius は同等性能を維持しながら推論エンドツーエンド速度を約 4 倍に高速化した。
あなたへの影響
知識と推論の分離設計は LLM の学習・デプロイ両面でコスト削減のポテンシャルを示す。
推奨:メモリ構造を最適化することで、既存モデルの継続学習でも推論速度を約 4 倍に引き出せる点から、推論コスト削減が必要なチームは当該論文の実装手法と推論プロファイルを参考値として評価する価値がある。