跳到正文

#评测/基准

今日 0 条
4月2日周三
2月18日周二
2月14日周五
  1. Hugging Face Blog73

    Hugging Face 用 Math-Verify 重新评估 Open LLM Leaderboard 全部模型

    Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。

    推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。

2月10日周一
2月4日周二
1月9日周四
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月4日周三
  1. Hugging Face Blog33

    Hugging Face 推出 AraGen:基于 3C3H 指标的阿拉伯语 LLM 评测基准与排行榜

    Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。

11月20日周三
  1. Hugging Face Blog38

    BAAI 推出首个多语言 LLM 辩论竞技场 FlagEval-Debate

    BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。

11月19日周二
10月30日周三
10月10日周四
10月4日周五
  1. Hugging Face Blog35

    Hugging Face 推出 Open FinLLM Leaderboard

    Hugging Face 发布 Open FinLLM Leaderboard,专为金融领域大语言模型提供透明评估框架。该榜单覆盖信息提取、情感分析等七大类任务,采用零样本评测方法,使用 Accuracy、F1 Score 等多维指标衡量模型在真实金融场景下的泛化能力与就绪度。

10月1日周二
  1. Hugging Face Blog30

    BenCzechMark 发布:首个全面评估大语言模型捷克语能力的基准

    Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。

8月13日周二
7月25日周四
7月1日周一
  1. Hugging Face Blog68

    Hugging Face 发布基于 Transformers Code Agent 的 GAIA 基准测试方案

    Hugging Face 使用基于 transformers.agents(现已升级为 smolagents)构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2% 的成绩,位列第一。该方案核心在于让 LLM 生成并执行 Python 代码而非 JSON,通过自底向上构建的安全解释器限制操作权限,并结合 Web 浏览、文件检查等工具及简单的规划组件实现多智能体协作。

    推荐理由:原文详细拆解了基于代码动作的 Agent 架构与安全执行机制,并展示了在 GAIA 基准上的具体得分与多智能体编排策略。

6月18日周二
6月6日周四
5月24日周五
5月14日周二
  1. Hugging Face Blog29

    Hugging Face 推出 Open Arabic LLM Leaderboard

    Hugging Face 推出 Open Arabic LLM Leaderboard (OALL),旨在评估阿拉伯语大语言模型性能,服务全球超 3.8 亿使用者。该榜单整合 AlGhafa、ACVA 等基准数据集,采用归一化对数似然准确率作为核心指标,并基于 lighteval 库实现开箱即用的评测支持。

5月5日周日
5月3日周五
  1. Hugging Face Blog60

    Hugging Face 上线 Artificial Analysis LLM 性能排行榜

    Hugging Face 正式集成 Artificial Analysis LLM Performance Leaderboard,覆盖超过100个 serverless LLM API 端点。该榜单综合评估模型的质量(基于 MMLU、HumanEval 等)、上下文窗口、定价及推理速度(吞吐量与延迟),支持不同提示长度和并行查询场景下的性能对比。

    推荐理由:Hugging Face 引入 Artificial Analysis 排行榜,整合了超过100个API端点的价格、速度和质量数据,为工程师选型提供多维参考。

4月30日周二
4月23日周二
4月19日周五
4月16日周二
  1. Hugging Face Blog44

    Hugging Face 上线 LiveCodeBench 排行榜:无数据污染的代码 LLM 综合评测

    Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。

3月5日周二
  1. Hugging Face Blog29

    ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力

    UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。

2月27日周二
  1. Hugging Face Blog40

    Hugging Face 推出 TTS Arena:基于社区投票的文本转语音模型基准测试

    Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。

2月20日周二
  1. Hugging Face Blog33

    Upstage 推出 Open Ko-LLM Leaderboard:构建韩语大模型评估生态

    Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。

2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。

1月31日周三
1月29日周一
1月26日周五
1月18日周四
1月12日周五
12月1日周五
  1. Hugging Face Blog40

    Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因

    Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。

9月18日周一
  1. Hugging Face Blog38

    Hugging Face 发布目标检测排行榜及评估指标详解

    Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。

6月23日周五
  1. Hugging Face Blog65

    Hugging Face 解析 Open LLM Leaderboard 中 MMLU 评分差异原因

    Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。

    推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。