Cerebras 跑 Qwen 3.8 达 1500 token/s
推荐指数 53.0 NO. 014 · 2026.09.04
发布2026/09/03Score258Comments83
为什么值得看
Cerebras 在其 AI 加速器上部署了 Qwen 3.8 27B 模型,推理速度达到 1500 tokens/s。对需要低延迟大模型推理的 AI 应用来说,这提供了 GPU 集群之外的高性能替代方案,且模型未经剪枝、仅做存储层量化,精度损失可控。
编辑判断
Cerebras 这次刻意强调"unpruned"和"selective weight-only quantization",是在打 NVIDIA H100/B200 的软肋——GPU 集群做高并发推理时,为了吞吐量往往要做激进的 KV cache 压缩或模型剪枝,精度换速度。
但 1500 tokens/s 这个数字需要拆解:这是单用户延迟还是聚合吞吐量?如果是前者,那比 Groq 的 Llama 3 70B(约 800 tokens/s)还快近一倍,对实时对话、代码补全场景是质变。如果是后者,则含金量打折扣。
做 AI 应用的团队可以算一笔账:Cerebras 的按 token 定价 vs 自购 H100 的摊销成本,在日均 100M tokens 以上的规模下,专用芯片可能开始划算。建议拿自己的 prompt 长度分布去跑实测,别被峰值 speed 数字带偏。
社区反馈
意见分歧 83 条评论
核心争论:Cerebras 推理服务是真实硬件优势还是营销广告,定价策略是否诚意不足
I used their Coding Plan for a few months. It is genuinely difficult to keep up with the models. The output is so fast. Qwen 3.8 27B is likely one of the strongest models they've hosted so far. Edit: it looks like this is only available on a API token pricing. Does anyone know if they have rolled ou
Agreed, but in our SAAS I can tell some UX will sky-rocket to next level with this
It appears that they do support Prompt Caching: https://inference-docs.cerebras.ai/capabilities/prompt-cachi...