Asayomu Tech
注目★★★★Hugging Face Papers

ZGCM-1-7B、4.2倍効率化で数学・Agentic Searchに挑む

30秒で把握

  • 1ZGCM-1-7Bが内部推論と外部ツール利用で数学・検索に対応
  • 216K事前学習のtime-to-loss効率を約4.2倍向上
  • 3256KコンテキストとMDP中間学習、全学習資産を公開

要約

ZGCM-1は、内部推論と外部ツール利用を組み合わせた、完全公開の7B密モデルだ。16K・64K・256Kへ段階的にコンテキストを拡張し、滑動窓注意と全注意の交互構成、FP8 Muon optimizer、MDP形式の中間学習を採用した。数学推論とAgentic Searchでは、Qwen3-235B-A22BやGLM-5.1のような桁違いに大きいモデルと競合し、一般ベンチマークではQwen3-8Bに匹敵した。16K事前学習のtime-to-loss効率は約4.2倍向上した。重み、各段階のチェックポイント、学習コード、データ、レシピ、W&Bログを公開した。

あなたへの影響

LLMを研究・運用する日本のエンジニアは、公開された重みだけでなく学習コードやデータを使って、長文脈推論と外部ツール連携の再現性を次の検証スプリントで評価するとよい。

推奨:Agentic Searchはモデルが検索などの外部ツールを能動利用する構成を指す。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。