注目★★★★★Hugging Face Papers
ノート PC から 753B モデルまで、エッジ端末で大規模 MoE を実行する FreeToken
30秒で把握
- 1FreeToken がエッジ端末で 753B 規模 MoE モデルをシングル GPU 実行可能に・20 以上のモデル対応
- 2動的リソース配置で 8GB ノート PC から単一ワークステーション GPU まで段階的スケーリングに対応
- 3オープンウェイトモデルのローカル実行が実用域に到達・デプロイ環境の評価と推論ベンチマーク実施を検討
要約
FreeToken は個人マシン上で大規模 MoE (Mixture of Experts) モデルを効率的に実行するエッジネイティブ推論システムである。モデルレイアウト・エキスパート配置・CPU-GPU 実行・メモリ管理を統合的に最適化し、エージェントのワークロード変化と異なるハードウェアリソースの不均衡に対応する動的マッピングを実現した。8GB ノート PC GPU で 35B モデル、ゲーミングデスクトップで 284B モデル、単一ワークステーション GPU で 753B GLM-5.2 を実行可能にし、20 以上の MoE モデルと実際のコード生成・ツール利用エージェントに対応する。従来はデータセンタ前提だったオープンウェイト大規模モデルをローカル実行可能な実用プラットフォームに転換した。
あなたへの影響
オープンウェイト大規模モデルをローカル実行したいチームは、ハードウェアスペックに応じた動的リソース配置で実現可能な範囲が大きく広がるため。
推奨:導入環境 (GPU メモリ・CPU リソース) を把握した上で推論性能のベンチマークを実施し、本番運用時の遅延・スループット要件を確認する価値がある。