Asayomu Tech
注目★★★★Hugging Face Papers

NCP-ArchPreview、8.9Bモデルで概念予測を導入

30秒で把握

  • 1NCP-ArchPreviewがNTPと概念予測を共同学習する8.9Bモデルを構築
  • 25.73Tトークンで学習しOLMo-3-7B比GSM8Kが5.99ポイント向上
  • 351.3%のトークン消費で同等損失、17Mパラメータでドメイン適応

要約

NCP-ArchPreviewは、従来のNext-Token Predictionに加えて、複数トークンにまたがる離散概念を予測するNext Concept Predictionを共同学習する潜在空間言語モデルだ。8.9BパラメータでDolma-3の5.73Tトークンを学習し、OLMo-3-7Bの最終事前学習損失を51.3%のトークン消費で達成した。全学習後の下流タスク平均はOLMo-3-7Bを2.45ポイント上回り、GSM8Kでは5.99ポイント向上した。標準計算量の85%で、同じ8.9Bパラメータのベースラインに近い学習損失へ到達した。さらに、17MパラメータのVQモジュール更新だけでドメイン適応でき、DFlash2への概念表現注入で平均受理長が4.17%伸びた。

あなたへの影響

LLMの事前学習効率やドメイン適応を検証する日本の研究・開発チームは、NCPと潜在空間の構成を次スプリントで評価するとよい。

推奨:概念表現を別モジュールとして扱う設計は、全体再学習を抑えた適応手法につながり得るため、既存モデルとの損失・下流性能・計算量を比較検証すべきだ。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。