Spec Decoding (DSpark) 终于在 vLLM 中支持了 Pipeline Parallelism!!🔥 许多 GPU 贫困/无产阶级用户一直呼吁此功能,但直到近期 Kimi K3 的 2.8T 参数规模冲击 GPU 中产阶级(B200),该功能才得以实现!
在此更改之前,需要使用 Pipeline Parallelism 的 GPU 穷人,由于其权重无法完全放入单个服务器,因此无法利用 DSpark。感谢 yongqinwang-cmd & Inferact 在 vLLM 中实现了这一功能!

