注目★★★★★Hacker News
Qwen 3.8 27B、Cerebrasで毎秒1500トークン
30秒で把握
- 1Cerebras が Qwen 3.8 27B を毎秒1500トークンで提供
- 2公開モデルは原版を維持し、重み保存時だけ選択的に量子化
- 3activation・attention・KV cache はフル精度で処理し、REAP版は研究用提供
要約
Cerebras は Qwen 3.8 27B を公開エンドポイントで提供し、毎秒1500トークンの速度に対応した。公開モデルは原版のままで、pruning による構造変更は行っていない。重みは保存時のみ選択的に16bit・8bit・4bit量子化し、機密性の高い層やactivation、attention、KV cacheはフル精度で処理する。REAPでpruningしたモデルは研究用に公開されているが、共有APIでは提供しない。
あなたへの影響
Cerebras のAPIを利用する日本の開発チームは、Qwen 3.8 27Bの速度と品質を自社ワークロードで検証し、モデル名と提供エンドポイントを確認するとよい。
推奨:pruningはモデルの一部を恒久的に削除して構造を変える手法で、量子化とは異なる。