AMAZINGINDEX.COM 日报快照
56.4
VOL. 2026.08
2026.08.14
← 返回 2026.08.14 日报
日报快照 · Daily Snapshot
NO. 022

Cerebras 让 GPT-5.6 提速至 750 t/s

#ARTICLE HackerNews 2026.08.14
推荐指数 50.0 NO. 022 · 2026.08.14
发布2026/08/13Score71Comments10

Cerebras 与 OpenAI 合作推出 Ultrafast Mode,GPT-5.6 Sol 输出速度达 750 tokens/秒且声称不损失质量。对延迟敏感的实时应用(如交易、客服、代码补全)而言,这打破了"大模型必慢"的固有 trade-off。

Cerebras 的 WSE-3 芯片面积是 GPU 的 50 倍以上,内存带宽优势使其在 batch=1 的实时推理场景碾压 H100 集群——这正是传统云厂商的软肋。OpenAI 选择合作而非自研硬件,说明其推理基础设施存在缺口,也在试探"速度溢价"的商业模式。

750 t/s 意味着 1000 字中文约 2 秒输出,已接近人类阅读速度上限,实时交互的卡顿感基本消除。但"无质量妥协"的说法需谨慎看待:Cerebras 的精度通常指与 FP16 基准对比,而非与 GPT-4o 等更强模型对比。实际选型时建议用自己的 prompt 集做 A/B,而非轻信厂商 benchmark。

对创业团队而言,这是一个信号:纯靠"比 OpenAI 快"做推理中间商的空间在缩小,差异化应转向垂直场景优化(如金融合规延迟、医疗实时决策)或模型层面的投机解码(speculative decoding)创新。

正面 9 条评论

核心争论:速度已成大模型新战场,但价格与可及性仍是未知数

HawtAds

Their dinner plate chips are impressive.

crazysim

GPT 5.6 Luna Ultrafast when?

GodelNumbering

The corresponding OpenAI post https://openai.com/index/previewing-ultrafast/ There is no pricing info, which could mean it's "if you have to ask..." territory or they are simply gauging interest before deciding

替代方案: DeepSeek flashGemini 3.7 FlashFable 5Opus 4.8Cursor's Composer
查看原文 →