2个月造出TensorRT级推理引擎
推荐指数 56.0 NO. 008 · 2026.05.07
Stars164创建今天Forks5Issues3
为什么值得看
TokenSpeed 是一个追求极致性能的 LLM 推理引擎,目标是 TensorRT-LLM 的性能 + vLLM 的易用性。目前仅发布预览版支持 Kimi K2.5 和 TokenSpeed MLA 在 B200 上的复现,核心功能如 PD 分离、EPLB、KV Store 等仍在开发中。
TokenSpeed is a speed-of-light LLM inference engine.
媒体预览
编辑判断
做高性能推理的团队目前主要在 TensorRT-LLM 和 vLLM 之间做痛苦选择:前者性能顶但封闭难用,后者灵活但吞吐差距明显。TokenSpeed 的团队背景值得注意——两个月做出预览版且直接对标 B200 上的 SOTA 结果,说明不是从零开始,大概率有 NVIDIA 或头部大厂的 infra 背景。
真正的风险在于"预览版"的诚意:MLA 和 Kimi K2.5 都是月之暗面的技术,如果团队与 Kimi 有深度绑定,后续模型覆盖(如 Qwen、DeepSeek)的优先级可能存疑。建议等 PD 分离和 EPLB 合并后再评估,现在 star 一下保持跟踪即可,生产环境切换为时尚早。
Star History
生态分析
Experimental
面向Blackwell架构的极致性能LLM推理新玩家,对标TensorRT-LLM性能与vLLM易用性
独特价值:聚焦B200硬件优化,率先支持Kimi K2.5和TokenSpeed MLA架构复现
竞品: