跳到正文

#评测/基准

今日 0 条
1月12日周五
12月1日周五
  1. Hugging Face Blog40

    Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因

    Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。

9月18日周一
  1. Hugging Face Blog38

    Hugging Face 发布目标检测排行榜及评估指标详解

    Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。

6月23日周五
  1. Hugging Face Blog65

    Hugging Face 解析 Open LLM Leaderboard 中 MMLU 评分差异原因

    Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。

    推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。

6月12日周一
12月14日周三
10月19日周三
  1. Hugging Face Blog45

    Hugging Face 发布 MTEB:涵盖 56 个数据集的大规模文本嵌入基准测试

    Hugging Face 推出 MTEB,这是一个包含 56 个数据集、8 类任务及超过 2000 项结果的大规模文本嵌入基准。该基准支持 112 种语言,旨在帮助用户根据速度、性能及多语言能力选择最佳嵌入模型。开发者可通过 `pip install mteb` 安装库并运行代码,将任意模型的评测结果提交至公开排行榜。

10月3日周一
6月28日周二
  1. Hugging Face Blog48

    Hugging Face 推出 Evaluation on the Hub:基于 AutoTrain 实现零代码模型评估

    Hugging Face 发布 Evaluation on the Hub,利用 AutoTrain 让用户在 Hub 上对任意模型和数据集进行零代码评估。该工具将结果直接编码至模型卡片元数据,并通过 Pull Request 自动更新已验证性能。它支持查找最佳模型、在新数据集上运行基线及跨数据集评估,旨在解决 AI 领域的评估危机并提升可复现性。

6月20日周六
12月3日周二
8月23日周四
8月6日周一
7月18日周三