NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中性能领先
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。
推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。