K8s GPU 预测性自动扩缩容
推荐指数 69.0 NO. 025 · 2026.08.29
发布2026/08/28
为什么值得看
CNCF 博客分享了一种基于负载预测的 GPU 工作流自动扩缩容方案,能在流量 spike 到来前提前完成节点预热。对运行推理服务的团队来说,这意味着可以彻底告别凌晨 3 点的扩容告警。
编辑判断
目前主流方案是 KEDA + Prometheus 的 reactive 扩容,延迟通常在 2-5 分钟,对冷启动动辄 10 分钟以上的 GPU 节点完全来不及。这篇方案的核心差异是引入了基于历史流量模式的提前量(look-ahead)调度,本质上把扩容从 event-driven 改成了 time-series-forecasting-driven。
和 AWS 的 predictive scaling 或 GCP 的 scheduled based scaling 相比,这个方案更针对 GPU 场景的痛点:显存碎片、节点亲和性、以及多租户集群下的资源抢占。如果你的推理服务有明显的日活波峰波谷(比如 AIGC 应用),但还没做 custom metrics 的 proactive scaling,这是目前最接地气的工程参考。