Hugging Face 推出 BenchMIRT:审计 LLM 基准测试中各提示词的实际测量能力
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。
Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。
推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。
DiG-bench 显示 Opus 5 和 Fable 5 在 Tier 7 任务中表现最佳,但当前前沿模型仍难超越人类。Paradigm Research 推出 RSI Simulator 以模拟递归自我改进过程。Inherent 发布开源权重模型 Faraday,旨在通过监督前沿模型展现科研品味。
Hugging Face 推出 Real World VoiceEQ 基准,旨在评估语音 AI 在真实对话中的“人类质量”,涵盖语气、情感和背景语境等转录文本无法体现的信息。
Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。
OpenAI 发布 LifeSciBench,这是一个由专家编写并审核的基准测试。该工具旨在评估 AI 系统在处理真实世界生命科学研究任务及决策时的表现能力。
Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。
Google Research 指出传统 AI 评测中每项仅用 3-5 名评估者不足以捕捉人类分歧,可靠结果往往需要超过 10 名评估者。研究通过模拟实验发现,最优的“广度”(多项目少人)与“深度”(少项目多人)比例取决于具体指标:追求多数票准确率宜采用广度策略,而捕捉意见细微差别则需增加评估者人数。在正确平衡下,约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。
Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。
Google Research 联合康奈尔大学测试六款 LLM 回答高温超导专家级问题的能力,发现 NotebookLM 和定制 RAG 系统表现最佳。该研究发表于 PNAS,旨在探索 AI 作为科研思维伙伴的潜力,结果显示封闭数据源比开放网络访问更能保证科学准确性。
Google DeepMind 与 Kaggle 合作发布 FACTS Benchmark Suite,包含参数化、搜索、多模态及 Grounding v2 四个基准,共提供 3,513 个公开示例。
Google Research 在 NeurIPS 2025 上推出 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的八项核心听觉能力。该基准包含新开源的 SVQ 数据集,涵盖 177,352 条跨 26 个地区、17 种语言的语音查询。实验显示当前声音表示远非通用,在所有任务中存在显著性能提升空间。
Hugging Face 在 Open ASR Leaderboard 中新增多语言和长音频转录赛道,对比了来自 18 个组织的 60+ 模型。数据显示 Conformer 编码器结合 LLM 解码器(如 Canary-Qwen-2.5B)准确率最高,而 CTC/TDT 解码器速度提升 10–100 倍;长音频场景下闭源系统仍领先,开源最佳为 Whisper Large v3。
Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。
推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。
Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。
Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。
Hugging Face 推出 3LM,这是首个专门评估阿拉伯语大语言模型在 STEM 领域及代码生成能力的基准。该基准包含 Native STEM、Synthetic STEM 和 Arabic Code Benchmarks 三个数据集,覆盖从真实教材到合成高难度问题的多类场景。
Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。
Hugging Face 发布 FutureBench,通过让 AI Agent 预测新闻与 Polymarket 市场中的未来事件来评估其推理能力。该基准利用 DeepSeek-V3 生成每周约 5 个时效性问题,并整合 Polymarket 数据,旨在解决传统测试集的数据污染问题并提供可验证的客观评分。
Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。
Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。
推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。
Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。
Hugging Face 与 MBZUAI 合作上线 Arabic-Leaderboards,新增首个公开阿拉伯语指令遵循基准及 AraGen-03-25。AraGen 数据集扩充至 340 对问答,o1-2024-12-17 以 69.49% 的 3C3H 得分保持榜首,gpt-4o-2024-08-06 排名显著上升。
Hugging Face 与 2A2I、TII 等机构推出第二代 Open Arabic LLM Leaderboard,旨在解决初代版本在算力门槛与结果真实性上的局限。该榜单已吸引超 46,000 访客并收录逾 700 个模型,涵盖从 1B 到 70B+ 参数规模,成为阿拉伯语 NLP 社区最活跃的评测平台之一。
Adyen和Hugging Face共同推出了DABstep(Data Agent Benchmark for Multi-step Reasoning),这是一个包含450多个真实世界数据分析任务的基准测试,旨在评估LLM和AI智能体的能力。
Hugging Face 在 Open LLM Leaderboard 中集成碳足迹估算,分析自 2024 年 6 月以来评估的 3,000 多个开源大语言模型的推理能耗。数据显示社区微调模型通常比官方模型更具碳效率,Qwen-2.5-14B 和 Phi-3-Medium 展现出最佳的分数与排放比。
Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。
推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。
Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。
BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。
Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,利用 Llama-2-Chat-7b 对 Docmatix 数据集进行零样本 VQA 评估。
Hugging Face 推出 BigCodeBench,包含 1,140 个函数级任务,覆盖 139 个库,平均分支覆盖率 99%。该基准旨在解决 HumanEval 任务过于简单及数据污染问题,通过 calibrated Pass@1 评估 LLM 在复杂真实场景下的代码生成能力。
Artificial Analysis 推出基于人类偏好的文生图模型排行榜,利用超45,000次投票计算 ELO 分数。结果显示 Midjourney、DALL·E 3 HD 等专有模型领先,但 Playground AI v2.5 等开源模型正迅速追赶并超越部分闭源产品。用户可在 Hugging Face 参与 Image Arena,投满30票即可获取个性化排名。
Meta 推出开源基准测试框架 CyberSecEval 2,用于评估 LLM 在代码解释器滥用、攻击性能力及提示注入方面的安全风险。数据显示,自 2023 年 12 月首版以来,LLM 协助网络攻击的平均合规率已从 52% 降至 28%,但提示注入防御仍是未解难题。
Hugging Face 联合 Dottxt 提出通过结构化生成解决 LLM 评估对提示格式敏感的问题。实验显示,同一模型在 MMLU 任务中因提示格式微调导致准确率波动高达 10 分,如 Qwen1.5-7B 从 51.2% 降至 22.9%,且 few-shot 样本顺序也会引入约 3 分的差异。
Hugging Face 发布 Open Medical-LLM Leaderboard,通过 MedQA、MedMCQA 等数据集以准确率评估 LLM 在医疗问答中的表现。该榜单旨在解决 GPT-3 等模型在医疗场景下可能产生严重错误的问题,推动更可靠的医疗 AI 发展。
Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。
UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。
Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。
Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。