744B模型跨7张消费级GPU推理
推荐指数 83.0 NO. 001 · 2026.06.20
Stars208创建4 天前Forks19Issues0
为什么值得看
Shard 实现流水线并行推理,将超大规模模型拆分为连续层块分布到多台机器的 GPU 上,通过流式传输激活值完成推理。首次在广域网上以约30 tok/s速度运行744B参数模型,无需数据中心或单节点持有完整模型。
Pipeline-parallel LLM inference across GPUs on separate machines.
编辑判断
之前大模型分布式推理的主流方案是 vLLM 的 TP+PP 组合或 Megatron-LM,但这些都要求节点间高带宽 NVLink 或 InfiniBand,本质上锁死在数据中心内部。Shard 的差异化在于容忍广域网延迟,用流水线气泡掩盖网络开销,把推理成本结构从"数据中心租金"变成"散户 GPU 拼盘"。
跟 Petals、Distributed Llama 等去中心化推理项目相比,Shard 的确定性 greedy decoding 保证了输出一致性,这对生产环境是关键优势,但 13 层 per node 的切分策略对通信量敏感,实际吞吐会随网络抖动大幅波动。
最适合两类人尝试:一是手里有多台异地消费级显卡的个人研究者,想跑 70B+ 模型但买不起 A100/H100 集群;二是在探索"边缘云推理"商业模式的团队,验证 WAN 延迟下的服务等级协议是否可接受。
Star History
生态分析
Experimental
首个实现广域网流水线并行LLM推理的开源方案,突破数据中心限制。
独特价值:无需单节点完整模型,跨机器GPU以30tok/s运行744B模型。