AMAZINGINDEX.COM 日报快照
54.2
VOL. 2026.08
2026.08.19
← 返回 2026.08.19 日报
日报快照 · Daily Snapshot
NO. 003

开源芯片把KV缓存压缩搬进硬件

#REPO GitHub Search 2026.08.19
推荐指数 72.0 NO. 003 · 2026.08.19
Stars328创建1 天前Forks0Issues0

首个全开源、验证优先的LLM推理芯片tile,将attention计算与KV缓存压缩集成到同一硬件数据通路。对做端侧推理和定制AI芯片的团队,这是可直接跑Qwen模型的真实RTL+FPGA工程参考。

An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.

开源芯片把KV缓存压缩搬进硬件

做推理芯片的团队过去要么买英伟达HBM硬扛带宽墙,要么在软件层做稀疏化/量化牺牲精度,这个tile把压缩直接做到数据通路里是更根本的解法。跟Groq的SRAM方案或Cerebras的晶圆级方案不同,它走的是"小芯片+压缩"路线,成本模型更接近边缘部署。

目前还是pre-silicon,所有数字标明了measured/projected,这个诚实标签本身在硬件圈就很罕见。如果你在评估自研推理芯片的可行性,这是比看论文更靠谱的起点——有golden model bit-exact验证,也有真实FPGA bringup。

Star History
Experimental

首个全开源验证优先的端侧LLM推理芯片RTL参考设计,填补学术到工业芯片实现的空白。

独特价值:唯一公开bit-exact验证的完整Transformer decoder层RTL,可直接跑真实Qwen模型。

查看原文 →