UK AISI 与 EvalEval 合作实现基准测试结果可复现
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。
推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。
DiG-bench 显示 Opus 5 和 Fable 5 在 Tier 7 任务中表现最佳,但当前前沿模型仍难超越人类。Paradigm Research 推出 RSI Simulator 以模拟递归自我改进过程。Inherent 发布开源权重模型 Faraday,旨在通过监督前沿模型展现科研品味。
Hugging Face 推出 Real World VoiceEQ 基准,旨在评估语音 AI 在真实对话中的“人类质量”,涵盖语气、情感和背景语境等转录文本无法体现的信息。
Hugging Face 与 Every Eval Ever (EEE) 实现互操作,支持在模型页展示并链接至标准化元数据存储。该集成允许用户通过转换器将 EEE 记录同步至 Community Evals,目前数据仓库已包含约 229,000 条评测结果、覆盖超 22,000 个模型及 2,200 个基准测试。
Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。
Hugging Face 联合 Appen Inc. 和 DataoceanAI 在 Open ASR Leaderboard 中新增覆盖多口音的高质量私有 ASR 数据集,旨在防止基准测试优化(benchmaxxing)及测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过切换开关查看私有数据影响。
Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。
Google Research 指出传统 AI 评测中每项仅用 3-5 名评估者不足以捕捉人类分歧,可靠结果往往需要超过 10 名评估者。研究通过模拟实验发现,最优的“广度”(多项目少人)与“深度”(少项目多人)比例取决于具体指标:追求多数票准确率宜采用广度策略,而捕捉意见细微差别则需增加评估者人数。在正确平衡下,约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。
Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。
Google Research 联合康奈尔大学测试六款 LLM 回答高温超导专家级问题的能力,发现 NotebookLM 和定制 RAG 系统表现最佳。该研究发表于 PNAS,旨在探索 AI 作为科研思维伙伴的潜力,结果显示封闭数据源比开放网络访问更能保证科学准确性。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。
Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。
NVIDIA AI-Q 在 DeepResearch Bench“LLM with Search”类别中以 40.52 分登顶,成为首个完全开源且领先的深度研究智能体。
Hugging Face 推出 3LM,这是首个专门评估阿拉伯语大语言模型在 STEM 领域及代码生成能力的基准。该基准包含 Native STEM、Synthetic STEM 和 Arabic Code Benchmarks 三个数据集,覆盖从真实教材到合成高难度问题的多类场景。
Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。
Hugging Face 发布 FutureBench,通过让 AI Agent 预测新闻与 Polymarket 市场中的未来事件来评估其推理能力。该基准利用 DeepSeek-V3 生成每周约 5 个时效性问题,并整合 Polymarket 数据,旨在解决传统测试集的数据污染问题并提供可验证的客观评分。
Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。
Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。
推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。
Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards,新增首个公开阿拉伯语指令遵循基准及 AraGen-03-25。AraGen 数据集扩充至 340 对问答,o1-2024-12-17 以 69.49% 的 3C3H 得分保持榜首,gpt-4o-2024-08-06 排名显著上升。
UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。
Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。
Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。
Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。
Patronus 团队基于 Hugging Face Leaderboard Template 发布 Enterprise Scenarios Leaderboard,旨在评估 LLM 在金融、法律、创意写作等 6 类真实企业用例中的表现。该榜单通过准确率、吸引力及 PII 处理等指标衡量模型能力,并采用部分闭源数据集以规避测试集污染问题。
Hugging Face 推出 Hallucinations Leaderboard,利用 EleutherAI Language Model Evaluation Harness 通过 in-context learning 评估 LLM 在事实性与忠实性方面的幻觉表现。
Hugging Face 推出由 HF leaderboard template 驱动的 LLM Safety Leaderboard,聚焦大模型安全评估。该榜单基于获 NeurIPS 2023 最佳论文奖的 DecodingTrust 平台,覆盖毒性、偏见等八个可信度维度。研究发现 GPT-4 比 GPT-3.5 更脆弱,且无单一模型在所有维度均表现最优。
Hugging Face 在两个 7B 模型上实证评估了 DPO、IPO 和 KTO 三种无需强化学习的对齐算法。修正后的实验显示,在配对偏好设置下 IPO 表现与 DPO 相当且优于 KTO。关键超参数 β 的调优对实现最佳性能至关重要。
Vectara 利用 Hugging Face leaderboard template 发布了 Hughes Hallucination Evaluation Model (HHEM) 排行榜,用于评估 LLM 生成摘要时的幻觉频率。该方案通过自定义代码实现动态更新,支持提交新模型请求并自动计算 Factual Consistency Rate 等指标。
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。