NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中性能领先
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
NVIDIA AI-Q 在 DeepResearch Bench“LLM with Search”类别中以 40.52 分登顶,成为首个完全开源且领先的深度研究智能体。
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
Hugging Face 联合 LLM-jp 发布 Open Japanese LLM Leaderboard,收录超 20 个数据集以评估日语大模型性能。该榜单基于 llm-jp-eval 套件,涵盖自然语言推理、代码生成等 16 类任务,采用 4-shot 模式运行。此举旨在解决日语处理挑战,推动开源模型开发的透明度与研究协作。
Hugging Face 发布 Open Chain of Thought Leaderboard,通过计算准确率增益(Δ = CoT准确率 - 无CoT准确率)评估LLM生成思维链的能力。该榜单基于LogiQA和LSAT等AGIEval任务,采用Classic与Reflect两种提示策略生成推理轨迹,旨在更稳健地衡量模型推理效能并抵抗训练数据污染。
Patronus 团队基于 Hugging Face Leaderboard Template 发布 Enterprise Scenarios Leaderboard,旨在评估 LLM 在金融、法律、创意写作等 6 类真实企业用例中的表现。该榜单通过准确率、吸引力及 PII 处理等指标衡量模型能力,并采用部分闭源数据集以规避测试集污染问题。