Hugging Face Blog·· 2023-12-01AI 评分40
Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因
Open LLM Leaderboard: DROP deep dive
AI 导读
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
来源:Hugging Face Blog · huggingface.co