AMAZINGINDEX.COM 日报快照
49.7
VOL. 2026.05
2026.05.07
← 返回 2026.05.07 日报
日报快照 · Daily Snapshot
NO. 008

2个月造出TensorRT级推理引擎

#REPO GitHub Search 2026.05.07
推荐指数 56.0 NO. 008 · 2026.05.07
Stars164创建今天Forks5Issues3

TokenSpeed 是一个追求极致性能的 LLM 推理引擎,目标是 TensorRT-LLM 的性能 + vLLM 的易用性。目前仅发布预览版支持 Kimi K2.5 和 TokenSpeed MLA 在 B200 上的复现,核心功能如 PD 分离、EPLB、KV Store 等仍在开发中。

TokenSpeed is a speed-of-light LLM inference engine.

2个月造出TensorRT级推理引擎

做高性能推理的团队目前主要在 TensorRT-LLM 和 vLLM 之间做痛苦选择:前者性能顶但封闭难用,后者灵活但吞吐差距明显。TokenSpeed 的团队背景值得注意——两个月做出预览版且直接对标 B200 上的 SOTA 结果,说明不是从零开始,大概率有 NVIDIA 或头部大厂的 infra 背景。

真正的风险在于"预览版"的诚意:MLA 和 Kimi K2.5 都是月之暗面的技术,如果团队与 Kimi 有深度绑定,后续模型覆盖(如 Qwen、DeepSeek)的优先级可能存疑。建议等 PD 分离和 EPLB 合并后再评估,现在 star 一下保持跟踪即可,生产环境切换为时尚早。

Star History
Experimental

面向Blackwell架构的极致性能LLM推理新玩家,对标TensorRT-LLM性能与vLLM易用性

独特价值:聚焦B200硬件优化,率先支持Kimi K2.5和TokenSpeed MLA架构复现

竞品:
vllm-project/vllm ★ 79.2k 成熟易用的开源标杆,目标性能基准与易用性参考对象
sgl-project/sglang ★ 27.1k 高性能服务框架,同属新兴推理引擎竞争赛道
查看原文 →