跳到正文
原文
Hugging Face Blog·· 2025-02-14精选AI 评分73

Hugging Face 用 Math-Verify 重新评估 Open LLM Leaderboard 全部模型

Fixing Open LLM Leaderboard with Math-Verify

AI 导读

Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。

推荐理由

原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。

来源:Hugging Face Blog · huggingface.co