LLM 服务该用 goodput 替代 throughput
推荐指数 68.0 NO. 026 · 2026.07.21
发布2026/07/20
为什么值得看
CNCF 提出评估 LLM 服务应采用 goodput(有效吞吐)而非传统 throughput,前者衡量用户实际获得有用 token 的速率。对做 LLM 推理 infra 的团队,这意味着需要重新设计负载测试指标和容量规划模型。
编辑判断
当前主流 benchmark 如 AnyScale 的 Serving Benchmark 和 LMSYS 的 Chatbot Arena 主要报告 throughput,这导致厂商倾向于用 batching 和 speculative decoding 刷高数字,却掩盖了长尾延迟和无效 token 的问题。Goodput 的提出实际上是把 SLO 从"系统能处理多少"转向"用户实际拿到多少有用输出"。
如果你在用 vLLM、TensorRT-LLM 或自研调度器,建议立刻检查你的 metrics 里有没有区分 prefill/decode 阶段的 token 有效性,以及是否把用户取消、超时请求算进了分母。这个指标 shift 可能会成为下半年 LLM infra 采购的硬性要求。
相关内容