NVIDIA LPU 支持三种解耦推理模式:
1. Rubin Prefill + LPU Decode,实现最快的交互速度2. Rubin Prefill + Rubin Decode Attention + LPU Decode FFN,适用于曲线中段3. Rubin Prefill + Rubin Decode Verification + LPU Drafter,适用于曲线中左侧对于低交互场景,原始 Rubin 仍占优势。期待在 AgentX 等开源智能体基准测试中看到 Rubin + LPU 的性能曲线。


