📢 首次在硅片上实测英伟达 Vera Rubin 性能,评估智能体(Agents)的实际运行表现。
⚡ 与 GB300 NVL72 相比,每兆瓦吞吐量最高提升 30 倍,Token 成本降低高达 35 倍。智能体会话与聊天或摘要工作负载截然不同。上下文会在数百个步骤中累积,可能达到数十万个 Token。英伟达在 @SemiAnalysis_ AgentX 工作负载上对 Vera Rubin 性能进行了测量,该负载使用 DeepSeek V4 Pro 模型包含真实的智能体编码轨迹。来源:NVIDIA_X


