UK AISI 与 EvalEval 合作实现基准测试结果可复现
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 预览测试中,Qwen3-VL 吞吐量较 GB300 NVL72 提升最高 3.7x,DeepSeek-R1 提升 2.5x。GB300 NVL72 实现 99% 扩展效率,软件优化使性能较 v6.0 提升 1.6x。
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。
推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。
Hugging Face 推出 Real World VoiceEQ 基准,旨在评估语音 AI 在真实对话中的“人类质量”,涵盖语气、情感和背景语境等转录文本无法体现的信息。
Hugging Face 与 Every Eval Ever (EEE) 实现互操作,支持在模型页展示并链接至标准化元数据存储。该集成允许用户通过转换器将 EEE 记录同步至 Community Evals,目前数据仓库已包含约 229,000 条评测结果、覆盖超 22,000 个模型及 2,200 个基准测试。
Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。
OpenAI 发布 LifeSciBench,这是一个由专家编写并审核的基准测试。该工具旨在评估 AI 系统在处理真实世界生命科学研究任务及决策时的表现能力。
Hugging Face 联合 Appen Inc. 和 DataoceanAI 在 Open ASR Leaderboard 中新增覆盖多口音的高质量私有 ASR 数据集,旨在防止基准测试优化(benchmaxxing)及测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过切换开关查看私有数据影响。
Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。
Google Research 指出传统 AI 评测中每项仅用 3-5 名评估者不足以捕捉人类分歧,可靠结果往往需要超过 10 名评估者。研究通过模拟实验发现,最优的“广度”(多项目少人)与“深度”(少项目多人)比例取决于具体指标:追求多数票准确率宜采用广度策略,而捕捉意见细微差别则需增加评估者人数。在正确平衡下,约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。
Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。
Google Research 联合康奈尔大学测试六款 LLM 回答高温超导专家级问题的能力,发现 NotebookLM 和定制 RAG 系统表现最佳。该研究发表于 PNAS,旨在探索 AI 作为科研思维伙伴的潜力,结果显示封闭数据源比开放网络访问更能保证科学准确性。
OpenAI 与太平洋西北国家实验室联合发布 DraftNEPABench,评估 AI 编码智能体加速联邦许可审批的能力。该基准显示,相关技术有望将 NEPA 起草时间缩短最多 15%,并推动基础设施审查现代化。
OpenAI 发布文章阐述其对当前 AI 评测基准的看法与分析。内容聚焦于评估标准的局限性及行业判断,未提及具体新模型或工具发布。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
Hugging Face 在 Open ASR Leaderboard 中新增多语言和长音频转录赛道,对比了来自 18 个组织的 60+ 模型。数据显示 Conformer 编码器结合 LLM 解码器(如 Canary-Qwen-2.5B)准确率最高,而 CTC/TDT 解码器速度提升 10–100 倍;长音频场景下闭源系统仍领先,开源最佳为 Whisper Large v3。
BigCode项目推出BigCodeArena,这是首个允许用户通过实际运行代码来评估和比较AI代码生成模型的众包平台。该平台支持Python、JavaScript等10种语言及React、PyGame等8种执行环境,用户可提交任务并投票选择表现更好的模型。
推荐理由:BigCodeArena通过引入实时执行反馈解决了代码生成评估中静态对比的局限,其数据揭示了不同模型在特定运行环境下的鲁棒性差异。
Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。
推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。
Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。
Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。
NVIDIA AI-Q 在 DeepResearch Bench“LLM with Search”类别中以 40.52 分登顶,成为首个完全开源且领先的深度研究智能体。
Hugging Face 推出 3LM,这是首个专门评估阿拉伯语大语言模型在 STEM 领域及代码生成能力的基准。该基准包含 Native STEM、Synthetic STEM 和 Arabic Code Benchmarks 三个数据集,覆盖从真实教材到合成高难度问题的多类场景。
Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。
Hugging Face 发布 FutureBench,通过让 AI Agent 预测新闻与 Polymarket 市场中的未来事件来评估其推理能力。该基准利用 DeepSeek-V3 生成每周约 5 个时效性问题,并整合 Polymarket 数据,旨在解决传统测试集的数据污染问题并提供可验证的客观评分。
Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。
Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。
推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。
Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards,新增首个公开阿拉伯语指令遵循基准及 AraGen-03-25。AraGen 数据集扩充至 340 对问答,o1-2024-12-17 以 69.49% 的 3C3H 得分保持榜首,gpt-4o-2024-08-06 排名显著上升。
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
Hugging Face 与 2A2I、TII 等机构推出第二代 Open Arabic LLM Leaderboard,旨在解决初代版本在算力门槛与结果真实性上的局限。该榜单已吸引超 46,000 访客并收录逾 700 个模型,涵盖从 1B 到 70B+ 参数规模,成为阿拉伯语 NLP 社区最活跃的评测平台之一。
Adyen和Hugging Face共同推出了DABstep(Data Agent Benchmark for Multi-step Reasoning),这是一个包含450多个真实世界数据分析任务的基准测试,旨在评估LLM和AI智能体的能力。
Hugging Face 在 Open LLM Leaderboard 中集成碳足迹估算,分析自 2024 年 6 月以来评估的 3,000 多个开源大语言模型的推理能耗。数据显示社区微调模型通常比官方模型更具碳效率,Qwen-2.5-14B 和 Phi-3-Medium 展现出最佳的分数与排放比。
Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。
推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。
Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。
BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。
Hugging Face 联合 LLM-jp 发布 Open Japanese LLM Leaderboard,收录超 20 个数据集以评估日语大模型性能。该榜单基于 llm-jp-eval 套件,涵盖自然语言推理、代码生成等 16 类任务,采用 4-shot 模式运行。此举旨在解决日语处理挑战,推动开源模型开发的透明度与研究协作。
Hugging Face 上线 Judge Arena,通过众包投票对比 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 等 18 款模型作为“LLM-as-a-Judge”的优劣。早期数据显示 GPT-4 Turbo 微弱领先,但 Qwen 2.5 7B 和 Llama 3.1 8B 等小参数开源模型表现强劲,与闭源模型竞争力相当。
Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。