跳到正文
原文
Hugging Face Blog·· 2023-12-01AI 评分40

Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因

Open LLM Leaderboard: DROP deep dive

AI 导读

Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。

来源:Hugging Face Blog · huggingface.co