70B大模型4GB显存推理
推荐指数 85.0 NO. 001 · 2026.08.03
Stars25,493
为什么值得看
AirLLM 通过层卸载和专家流式技术,让 70B 模型在 4GB GPU 上运行,405B Llama 3.1 仅需 8GB,2.8T 参数的 Kimi K3 不到 4GB。对 GPU 预算紧张的团队和边缘部署场景是刚需解法。
AirLLM 70B inference with single 4GB GPU
媒体预览
编辑判断
大模型推理显存瓶颈之前主要靠量化(GGUF/AWQ)或 vLLM 的 PagedAttention 来缓解,但量化会损精度,vLLM 对单卡小显存场景帮助有限。AirLLM 走的是另一条路:类似 DeepSpeed-Inference 的层卸载,但对 MoE 架构做了针对性优化——只加载当前 token 需要的专家而不是整层,这对 DeepSeek-V3、Kimi K3 这类稀疏 MoE 巨模型效果尤其夸张。
如果你在做私有化部署、API 成本敏感、或者想拿消费级显卡跑最新开源大模型,这个工具比折腾 4-bit 量化更省心。注意它目前主要是推理加速,训练场景不支持,且层卸载会带来延迟增加,实时性要求高的场景需要实测权衡。
Star History
生态分析
Production
大模型推理优化工具,专注超低成本GPU部署边缘场景
独特价值:层卸载+专家流式技术,实现70B模型4GB显存极限压缩推理
竞品: