AMAZINGINDEX.COM 日报快照
65.1
VOL. 2026.07
2026.07.20
← 返回 2026.07.20 日报
日报快照 · Daily Snapshot
NO. 003

CPU+GPU异构推理框架日更模型

#REPO GitHub Trending 2026.07.20
推荐指数 70.0 NO. 003 · 2026.07.20
Stars18,282

KTransformers 通过 CPU-GPU 异构计算实现大模型高效推理和微调,刚上线 MiniMax-M3、GLM-5.2 的 Day0 支持。适合显存不足但想跑大模型的团队,用消费级硬件就能省掉一大笔 GPU 集群成本。

A Flexible Framework for Experiencing Heterogeneous LLM Inference/Fine-tune Optimizations

CPU+GPU异构推理框架日更模型

大模型推理的显存瓶颈催生了 vLLM、TensorRT-LLM 这些纯 GPU 方案,但单卡 80G 也装不下 400B+ 的稠密模型。KTransformers 走了一条不一样的路:把稀疏层、KV Cache 甚至部分注意力计算卸到 CPU 和 DRAM,用 PCIe 带宽换显存容量。

跟 llama.cpp 的纯 CPU 路线比,它在 GPU 上保留了核心算子,速度更快;跟 DeepSpeed-Inference 比,它不需要多卡 NVLink,单卡 4090 就能跑 671B 的 MoE。目前 Day0 支持的速度很激进,MiniMax-M3 发布当天就适配完成,说明团队在做模型结构的提前解耦。

如果你在做私有化部署、边缘推理或者预算有限的创业团队,这个框架值得替代掉你现在的 llama.cpp 或 transformers 原生方案,尤其是 MoE 架构的模型。

Star History
Beta

消费级硬件跑大模型的异构推理基础设施

独特价值:CPU-GPU异构计算省显存,消费级硬件跑超大模型

竞品:
unslothai/unsloth ★ 25.0k 专注单卡微调加速,非异构推理框架
vllm-project/vllm ★ 45.0k 纯GPU高吞吐推理,不支持CPU-GPU异构
oobabooga/text-generation-webui ★ 42.0k 通用推理UI,无深度异构优化
mlc-ai/mlc-llm ★ 18.0k 多平台部署,异构支持较弱
Tencent/llm.hunyuan ★ 8.0k 腾讯自研推理,非开源框架
查看原文 →