GPU碎片调度进CNCF孵化
推荐指数 71.0 NO. 022 · 2026.07.16
发布2026/07/15
为什么值得看
HAMi是Kubernetes上的GPU虚拟化与调度系统,刚晋升CNCF孵化项目。它能将单张GPU切分给多个任务复用,解决AI infra团队常见的GPU资源碎片化导致的利用率低下问题。
编辑判断
GPU碎片化问题的传统解法依赖NVIDIA MIG或手动分配,但MIG仅支持A100/H100且配置僵化,而HAMi通过软件层实现更细粒度的显存与算力隔离,兼容更多GPU型号。
与同类方案相比,Run:AI被NVIDIA收购后闭源趋势明显,HAMi作为CNCF项目走中立开源路线,对担心vendor lock-in的团队更具长期价值。
如果你在用K8s管理超过50张GPU且利用率长期低于40%,建议两周内评估HAMi的vGPU方案,通常能把利用率拉到70%以上而不需要额外采购硬件。
相关内容
Reclaiming underutilized GPUs in Kubernetes using scheduler plugins 高端GPU常处于闲置状态,通过调度器插件回收未充分利用的GPU资源,解决碎片化导致的利用率低下问题。 GPU Partitioning: Fair Share Scheduling 实现GPU分区公平共享调度需协调调度前端、设备管理器和后端,处理POD与GPU内存、CUDA指令的协作。 Volcano正式晋级为CNCF孵化项目 华为云捐献的业界首个云原生批量计算项目Volcano于2022年晋级CNCF孵化项目,标志其技术生态获业界认可。 使用碎片梯度下降(FGD)调度GPU共享任务 ATC23论文提出碎片化梯度下降调度方法,通过量化GPU碎片化程度优化共享任务调度。 Prep EDU: Enabling Efficient GPU Orchestration for AI Inference PREP EDU基于Kubernetes构建异构GPU集群AI推理平台,关注RTX 4070/4090节点的兼容性与高效编排。