跳到正文

#评测/基准

今日 0 条
9月2日周三
  1. Hugging Face Blog42

    Hugging Face 推出 BenchMIRT:审计 LLM 基准测试中各提示词的实际测量能力

    Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 发布语音识别基准优化测量研究

    Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。

    推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。

8月17日周一
7月15日周三
6月24日周三
  1. Hugging Face Blog42

    Hugging Face 与 Treble Technologies 推出首个开源远场 ASR 基准 FFASR Leaderboard

    Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。

6月17日周三
4月21日周二
  1. Hugging Face Blog30

    Hugging Face 发布 QIMMA:首个通过质量验证的阿拉伯语 LLM 排行榜

    Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。

4月1日周三
  1. Google Research36

    Google Research 提出 AI 基准测试中评估者数量与样本量的权衡策略

    Google Research 指出传统 AI 评测中每项仅用 3-5 名评估者不足以捕捉人类分歧,可靠结果往往需要超过 10 名评估者。研究通过模拟实验发现,最优的“广度”(多项目少人)与“深度”(少项目多人)比例取决于具体指标:追求多数票准确率宜采用广度策略,而捕捉意见细微差别则需增加评估者人数。在正确平衡下,约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。

3月24日周二
  1. Hugging Face Blog48

    Hugging Face 发布语音智能体评估框架 EVA

    Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。

3月17日周二
12月9日周二
12月4日周四
11月21日周五
9月22日周一
  1. Hugging Face Blog68

    Hugging Face 发布 Gaia2 智能体基准与 ARE 开源框架

    Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。

    推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。

8月12日周二
  1. Hugging Face Blog30

    Hugging Face 发布 FilBench:评估 LLM 在菲律宾语言中的能力

    Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。

8月1日周五
7月23日周三
  1. Hugging Face Blog42

    Hugging Face 开源 TimeScope 基准测试长视频多模态模型理解能力

    Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。

7月17日周四
7月4日周五
  1. Hugging Face Blog28

    Hugging Face 宣布 NeurIPS 2025 E2LM Competition:早期训练评估语言模型

    Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。

6月6日周五
  1. Hugging Face Blog65

    Hugging Face 发布 ScreenSuite:最全面的 GUI 智能体评估套件

    Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。

    推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。

4月16日周三
  1. Hugging Face Blog42

    Hugging Face 发布 HELMET:全面评估长上下文语言模型的新基准

    Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。

4月8日周二
2月10日周一
2月4日周二
1月9日周四
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月4日周三
  1. Hugging Face Blog33

    Hugging Face 推出 AraGen:基于 3C3H 指标的阿拉伯语 LLM 评测基准与排行榜

    Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。

11月20日周三
  1. Hugging Face Blog38

    BAAI 推出首个多语言 LLM 辩论竞技场 FlagEval-Debate

    BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。

10月1日周二
  1. Hugging Face Blog30

    BenCzechMark 发布:首个全面评估大语言模型捷克语能力的基准

    Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。

7月25日周四
6月18日周二
6月6日周四
5月24日周五
4月30日周二
4月19日周五
4月16日周二
  1. Hugging Face Blog44

    Hugging Face 上线 LiveCodeBench 排行榜:无数据污染的代码 LLM 综合评测

    Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。

3月5日周二
  1. Hugging Face Blog29

    ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力

    UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。

2月20日周二
  1. Hugging Face Blog33

    Upstage 推出 Open Ko-LLM Leaderboard:构建韩语大模型评估生态

    Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。

2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。