Asayomu Tech
注目★★★★★Hacker News

Qwen 3.8 27B、Cerebrasで毎秒1500トークン

30秒で把握

  • 1Cerebras が Qwen 3.8 27B を毎秒1500トークンで提供
  • 2公開モデルは原版を維持し、重み保存時だけ選択的に量子化
  • 3activation・attention・KV cache はフル精度で処理し、REAP版は研究用提供

要約

Cerebras は Qwen 3.8 27B を公開エンドポイントで提供し、毎秒1500トークンの速度に対応した。公開モデルは原版のままで、pruning による構造変更は行っていない。重みは保存時のみ選択的に16bit・8bit・4bit量子化し、機密性の高い層やactivation、attention、KV cacheはフル精度で処理する。REAPでpruningしたモデルは研究用に公開されているが、共有APIでは提供しない。

あなたへの影響

Cerebras のAPIを利用する日本の開発チームは、Qwen 3.8 27Bの速度と品質を自社ワークロードで検証し、モデル名と提供エンドポイントを確認するとよい。

推奨:pruningはモデルの一部を恒久的に削除して構造を変える手法で、量子化とは異なる。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。