AMAZINGINDEX.COM 日报快照
58.0
VOL. 2026.06
2026.06.20
← 返回 2026.06.20 日报
日报快照 · Daily Snapshot
NO. 001

744B模型跨7张消费级GPU推理

#REPO GitHub Search 2026.06.20
推荐指数 83.0 NO. 001 · 2026.06.20
Stars208创建4 天前Forks19Issues0

Shard 实现流水线并行推理,将超大规模模型拆分为连续层块分布到多台机器的 GPU 上,通过流式传输激活值完成推理。首次在广域网上以约30 tok/s速度运行744B参数模型,无需数据中心或单节点持有完整模型。

Pipeline-parallel LLM inference across GPUs on separate machines.

之前大模型分布式推理的主流方案是 vLLM 的 TP+PP 组合或 Megatron-LM,但这些都要求节点间高带宽 NVLink 或 InfiniBand,本质上锁死在数据中心内部。Shard 的差异化在于容忍广域网延迟,用流水线气泡掩盖网络开销,把推理成本结构从"数据中心租金"变成"散户 GPU 拼盘"。

跟 Petals、Distributed Llama 等去中心化推理项目相比,Shard 的确定性 greedy decoding 保证了输出一致性,这对生产环境是关键优势,但 13 层 per node 的切分策略对通信量敏感,实际吞吐会随网络抖动大幅波动。

最适合两类人尝试:一是手里有多台异地消费级显卡的个人研究者,想跑 70B+ 模型但买不起 A100/H100 集群;二是在探索"边缘云推理"商业模式的团队,验证 WAN 延迟下的服务等级协议是否可接受。

Star History
Experimental

首个实现广域网流水线并行LLM推理的开源方案,突破数据中心限制。

独特价值:无需单节点完整模型,跨机器GPU以30tok/s运行744B模型。

查看原文 →