NVIDIA LPU 支持三種解耦推理模式:
1. Rubin Prefill + LPU Decode,實現最快的交互速度2. Rubin Prefill + Rubin Decode Attention + LPU Decode FFN,適用於曲線中段3. Rubin Prefill + Rubin Decode Verification + LPU Drafter,適用於曲線中左側對於低交互場景,原始 Rubin 仍佔優勢。期待在 AgentX 等開源智能體基準測試中看到 Rubin + LPU 的性能曲線。


