AMAZINGINDEX.COM 日报快照
50.4
VOL. 2026.07
2026.07.08
← 返回 2026.07.08 日报
日报快照 · Daily Snapshot
NO. 003

RTX 5090 手写 CUDA 内核碾压 llama.cpp

#REPO GitHub Search 2026.07.08
推荐指数 73.0 NO. 003 · 2026.07.08
Stars255创建1 天前Forks4Issues0

bw24 是一个从零用 Rust + CUDA 手写的 LLM 推理引擎,专为 RTX 5090 Laptop 调优,无框架依赖。9B 模型生成速度比 llama.cpp 快 1.3-1.6 倍,且能在 24GB 显存跑 121GB MoE 模型。

From-scratch Rust+CUDA LLM inference engine for RTX 5090 (sm_120a) — NVFP4, MoE, MTP speculative decoding, tuned against measured hardware limits

这个项目最狠的不是 beat llama.cpp,而是证明了一件事:当硬件代际跳跃足够大时,通用推理框架的抽象层反而成为瓶颈。llama.cpp 为了兼容从 GTX 1060 到 B200 的全谱系 GPU,kernel 设计必须取最大公约数,而 bw24 把 sm_120a 的 NVFP4 tensor core、异步拷贝、动态 boost 功耗曲线全部吃透,做了 llama.cpp 不可能做的激进特化。

它的 121GB MoE 跑在 24GB 卡上,靠的不是量化压缩比本身多强,而是 MTP speculative decoding + 混合精度加载的 pipeline 设计足够紧凑,让显存带宽和计算单元没有空转。这其实是给所有做端侧推理的团队提了个醒:如果你知道自己的部署硬件是什么,手写 kernel 的 ROI 正在变高,Blackwell 这一代尤其明显。

不过风险也在这里——它目前只验证了一台机器、几种模型结构,泛化性存疑。如果你在做消费级 GPU 上的推理产品,建议先拿你的目标模型跑它的 benchmark 脚本,重点看 medium/long prompt 的 parity 是否在你的场景里成立。

Star History
Experimental

RTX 5090 单卡极致性能实验性推理引擎,填补新架构sm_120a早期生态空白

独特价值:首个针对NVFP4+sm_120a从零手写内核,24GB显存跑121GB MoE的硬件极限探索

竞品:
ggerganov/llama.cpp ★ 78.0k 通用CPU/GPU推理,非针对单卡极致优化
vllm-project/vllm ★ 42.0k 服务化PagedAttention,非手写CUDA单卡
huggingface/text-generation-inference ★ 11.0k 生产级服务框架,非从零手写内核
mamba-org/mamba 无关项目,已剔除
查看原文 →