Hugging Face Blog·· 2025-02-14精选AI 评分73
Hugging Face 用 Math-Verify 重新评估 Open LLM Leaderboard 全部模型
Fixing Open LLM Leaderboard with Math-Verify
AI 导读
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由
原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
来源:Hugging Face Blog · huggingface.co