CPU+GPU异构推理框架日更模型
推荐指数 70.0 NO. 003 · 2026.07.20
Stars18,282
为什么值得看
KTransformers 通过 CPU-GPU 异构计算实现大模型高效推理和微调,刚上线 MiniMax-M3、GLM-5.2 的 Day0 支持。适合显存不足但想跑大模型的团队,用消费级硬件就能省掉一大笔 GPU 集群成本。
A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations
媒体预览
编辑判断
大模型推理的显存瓶颈催生了 vLLM、TensorRT-LLM 这些纯 GPU 方案,但单卡 80G 也装不下 400B+ 的稠密模型。KTransformers 走了一条不一样的路:把稀疏层、KV Cache 甚至部分注意力计算卸到 CPU 和 DRAM,用 PCIe 带宽换显存容量。
跟 llama.cpp 的纯 CPU 路线比,它在 GPU 上保留了核心算子,速度更快;跟 DeepSpeed-Inference 比,它不需要多卡 NVLink,单卡 4090 就能跑 671B 的 MoE。目前 Day0 支持的速度很激进,MiniMax-M3 发布当天就适配完成,说明团队在做模型结构的提前解耦。
如果你在做私有化部署、边缘推理或者预算有限的创业团队,这个框架值得替代掉你现在的 llama.cpp 或 transformers 原生方案,尤其是 MoE 架构的模型。
Star History
生态分析
Beta
消费级硬件跑大模型的异构推理基础设施
独特价值:CPU-GPU异构计算省显存,消费级硬件跑超大模型
竞品: