注目★★★★★Hugging Face Papers
NCP-ArchPreview、8.9Bモデルで概念予測を導入
30秒で把握
- 1NCP-ArchPreviewがNTPと概念予測を共同学習する8.9Bモデルを構築
- 25.73Tトークンで学習しOLMo-3-7B比GSM8Kが5.99ポイント向上
- 351.3%のトークン消費で同等損失、17Mパラメータでドメイン適応
要約
NCP-ArchPreviewは、従来のNext-Token Predictionに加えて、複数トークンにまたがる離散概念を予測するNext Concept Predictionを共同学習する潜在空間言語モデルだ。8.9BパラメータでDolma-3の5.73Tトークンを学習し、OLMo-3-7Bの最終事前学習損失を51.3%のトークン消費で達成した。全学習後の下流タスク平均はOLMo-3-7Bを2.45ポイント上回り、GSM8Kでは5.99ポイント向上した。標準計算量の85%で、同じ8.9Bパラメータのベースラインに近い学習損失へ到達した。さらに、17MパラメータのVQモジュール更新だけでドメイン適応でき、DFlash2への概念表現注入で平均受理長が4.17%伸びた。
あなたへの影響
LLMの事前学習効率やドメイン適応を検証する日本の研究・開発チームは、NCPと潜在空間の構成を次スプリントで評価するとよい。
推奨:概念表現を別モジュールとして扱う設計は、全体再学習を抑えた適応手法につながり得るため、既存モデルとの損失・下流性能・計算量を比較検証すべきだ。