Cerebras 让 GPT-5.6 提速至 750 t/s
推荐指数 50.0 NO. 022 · 2026.08.14
发布2026/08/13Score71Comments10
为什么值得看
Cerebras 与 OpenAI 合作推出 Ultrafast Mode,GPT-5.6 Sol 输出速度达 750 tokens/秒且声称不损失质量。对延迟敏感的实时应用(如交易、客服、代码补全)而言,这打破了"大模型必慢"的固有 trade-off。
编辑判断
Cerebras 的 WSE-3 芯片面积是 GPU 的 50 倍以上,内存带宽优势使其在 batch=1 的实时推理场景碾压 H100 集群——这正是传统云厂商的软肋。OpenAI 选择合作而非自研硬件,说明其推理基础设施存在缺口,也在试探"速度溢价"的商业模式。
750 t/s 意味着 1000 字中文约 2 秒输出,已接近人类阅读速度上限,实时交互的卡顿感基本消除。但"无质量妥协"的说法需谨慎看待:Cerebras 的精度通常指与 FP16 基准对比,而非与 GPT-4o 等更强模型对比。实际选型时建议用自己的 prompt 集做 A/B,而非轻信厂商 benchmark。
对创业团队而言,这是一个信号:纯靠"比 OpenAI 快"做推理中间商的空间在缩小,差异化应转向垂直场景优化(如金融合规延迟、医疗实时决策)或模型层面的投机解码(speculative decoding)创新。
社区反馈
正面 9 条评论
核心争论:速度已成大模型新战场,但价格与可及性仍是未知数
相关内容
GPT-5.6 Sol Hits 750 Tokens/Sec: Speed Is a Buying Test GPT-5.6 Sol在Cerebras硬件上达750 tokens/秒,约为现有生产模型5倍速度,对企业级多步骤代理任务意义重大。 Cerebras Runs OpenAI GPT-5.6 Sol at 750 Tokens per Second Cerebras将于7月在WSE-3芯片上部署GPT-5.6 Sol,速度达750 tokens/秒,比Nvidia GPU部署快约10倍,为其2026年IPO提供战略证明。 Getting the most out of GPT-5.6: Sol, Terra, and Luna Cerebras官方指南介绍GPT-5.6系列三档模型:Sol最强、Terra均衡、Luna最快最便宜,建议从Luna开始按需升级。
Their dinner plate chips are impressive.
GPT 5.6 Luna Ultrafast when?
The corresponding OpenAI post https://openai.com/index/previewing-ultrafast/ There is no pricing info, which could mean it's "if you have to ask..." territory or they are simply gauging interest before deciding