Vectara 基于 Hugging Face 模板发布 HHEM 幻觉排行榜
Vectara 利用 Hugging Face leaderboard template 发布了 Hughes Hallucination Evaluation Model (HHEM) 排行榜,用于评估 LLM 生成摘要时的幻觉频率。该方案通过自定义代码实现动态更新,支持提交新模型请求并自动计算 Factual Consistency Rate 等指标。
Vectara 利用 Hugging Face leaderboard template 发布了 Hughes Hallucination Evaluation Model (HHEM) 排行榜,用于评估 LLM 生成摘要时的幻觉频率。该方案通过自定义代码实现动态更新,支持提交新模型请求并自动计算 Factual Consistency Rate 等指标。
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。
Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。
推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。
Hugging Face 发布研究,探讨使用 GPT-4 等基础模型进行自动化数据标注和模型评估的可靠性,并将其作为 Open LLM Leaderboard 扩展的一部分。
推荐理由:通过对比人类标注与 GPT-4 自动评估,揭示了后者在偏好判断中的位置偏差及对冗长回复的过度奖励。
Hugging Face 展示 Habana Gaudi®2 在训练和推理上比 Nvidia A100 80GB 快约两倍。BERT 预训练中,Gaudi®2 相比初代 Gaudi 提速 3.04 倍,吞吐量达 1580.2 samples/s,优于 A100 的 981.6 samples/s。
Hugging Face 推出 MTEB,这是一个包含 56 个数据集、8 类任务及超过 2000 项结果的大规模文本嵌入基准。该基准支持 112 种语言,旨在帮助用户根据速度、性能及多语言能力选择最佳嵌入模型。开发者可通过 `pip install mteb` 安装库并运行代码,将任意模型的评测结果提交至公开排行榜。
Hugging Face 上线 Evaluation on the Hub,基于 AutoTrain 实现无需代码的零样本分类评估。该工具已升级基础设施,支持免费评估参数量达 66 billion 的大模型,处理 2000 条样本仅需 3.5 小时。
Hugging Face 发布 Evaluation on the Hub,利用 AutoTrain 让用户在 Hub 上对任意模型和数据集进行零代码评估。该工具将结果直接编码至模型卡片元数据,并通过 Pull Request 自动更新已验证性能。它支持查找最佳模型、在新数据集上运行基线及跨数据集评估,旨在解决 AI 领域的评估危机并提升可复现性。
OpenAI 宣布与 AIcrowd、卡内基梅隆大学及 DeepMind 共同组织两项 NeurIPS 2020 竞赛。赛事分别基于 Procgen Benchmark 和 MineRL 平台展开,旨在推动相关领域的算法研究与评估。
OpenAI 发布 Procgen Benchmark,包含 16 个程序化生成环境。该基准旨在直接衡量强化学习智能体学习可泛化技能的速度。
OpenAI Five 在温哥华举办的 The International 2018 上输给了两局 Dota 2 顶尖玩家。尽管最终失利,OpenAI Five 在两场比赛的前 20–35 分钟内均保持了良好的获胜机会。
OpenAI Five 在基准测试中三局两胜击败由 Blitz、Cap、Fogged、Merlini 和 MoonMeander 组成的 Dota 职业选手团队。该对手为 percentile 99.95 的顶尖玩家,其中四人拥有职业经历。比赛面向现场观众及 100,000 名直播并发观众进行。
OpenAI Five Benchmark 比赛现已结束。