AMAZINGINDEX.COM 日报快照
54.3
VOL. 2026.05
2026.05.28
← 返回 2026.05.28 日报
日报快照 · Daily Snapshot
NO. 026

KEDA 自定义 GPU 弹性伸缩实战

#ARTICLE CNCF Blog 2026.05.28
推荐指数 78.0 NO. 026 · 2026.05.28
发布2026/05/27

CNCF 官方博客发布基于 KEDA 构建 Kubernetes GPU 外部弹性伸缩器的完整工程方案,覆盖 vLLM、Triton 及 agentic inference 等场景。对跑 GPU 推理服务的团队,这是可直接落地的成本优化路径,避免资源闲置或排队延迟。

KEDA 自定义 GPU 弹性伸缩实战

目前 GPU 弹性伸缩的主流做法是 NVIDIA 的 DCGM Exporter + Prometheus Adapter,但配置复杂且指标粒度粗,往往只能按 GPU 利用率触发,无法感知推理队列深度或 token 生成延迟。KEDA 的外部 scaler 机制允许直接对接推理引擎的原生指标(如 vLLM 的 num_waiting_requests、time_to_first_token),实现更精准的冷启动扩容。

已有团队用类似方案把 GPU 集群利用率从 35% 拉到 70% 以上,关键是在缩容时设置足够的 graceful termination 窗口避免请求中断。如果你在用 vLLM 或 Triton 且还没做自动伸缩,建议优先复用这篇的 gRPC scaler 模板而不是从头写。

查看原文 →