PaperBench:评估 AI 智能体复现前沿 AI 研究的能力
OpenAI 推出 PaperBench,这是一个专门用于评估 AI 智能体复现前沿人工智能研究能力的基准测试。该基准旨在量化模型在重现最新科研成果方面的表现,为衡量 AI 系统的科研辅助能力提供标准化指标。
OpenAI 推出 PaperBench,这是一个专门用于评估 AI 智能体复现前沿人工智能研究能力的基准测试。该基准旨在量化模型在重现最新科研成果方面的表现,为衡量 AI 系统的科研辅助能力提供标准化指标。
OpenAI 发布 SWE-Lancer 基准测试,旨在评估前沿大语言模型在真实世界自由职业软件工程任务中的表现。该基准核心问题是检验 LLM 能否通过完成此类任务赚取 100 万美元收入。
Hugging Face 使用 Math-Verify 对 Open LLM Leaderboard 上所有 3,751 个提交模型进行了重新评估,以解决旧版 MATH-Hard 任务中因格式解析和符号比较导致的评分偏差问题。
推荐理由:原文展示了 Math-Verify 修复旧评估器缺陷的具体案例及重测数据,为开发者提供了更可靠的模型数学能力对比依据。
Hugging Face 与 2A2I、TII 等机构推出第二代 Open Arabic LLM Leaderboard,旨在解决初代版本在算力门槛与结果真实性上的局限。该榜单已吸引超 46,000 访客并收录逾 700 个模型,涵盖从 1B 到 70B+ 参数规模,成为阿拉伯语 NLP 社区最活跃的评测平台之一。
Adyen和Hugging Face共同推出了DABstep(Data Agent Benchmark for Multi-step Reasoning),这是一个包含450多个真实世界数据分析任务的基准测试,旨在评估LLM和AI智能体的能力。
Hugging Face 在 Open LLM Leaderboard 中集成碳足迹估算,分析自 2024 年 6 月以来评估的 3,000 多个开源大语言模型的推理能耗。数据显示社区微调模型通常比官方模型更具碳效率,Qwen-2.5-14B 和 Phi-3-Medium 展现出最佳的分数与排放比。
Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。
推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。
Hugging Face 发布 AraGen,这是首个针对阿拉伯语大语言模型的生成式任务基准与排行榜。该框架引入 3C3H 评估指标,利用 LLM-as-judge 从正确性、完整性等六个维度综合衡量模型的事实准确性与可用性。AraGen 采用为期三个月的盲测动态评估策略,旨在解决数据污染问题并为低资源语言提供公平评测标准。
BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。
Hugging Face 联合 LLM-jp 发布 Open Japanese LLM Leaderboard,收录超 20 个数据集以评估日语大模型性能。该榜单基于 llm-jp-eval 套件,涵盖自然语言推理、代码生成等 16 类任务,采用 4-shot 模式运行。此举旨在解决日语处理挑战,推动开源模型开发的透明度与研究协作。
Hugging Face 上线 Judge Arena,通过众包投票对比 GPT-4o、Claude 3.5 Sonnet、Llama 3.1 等 18 款模型作为“LLM-as-a-Judge”的优劣。早期数据显示 GPT-4 Turbo 微弱领先,但 Qwen 2.5 7B 和 Llama 3.1 8B 等小参数开源模型表现强劲,与闭源模型竞争力相当。
OpenAI 发布名为 SimpleQA 的事实性基准,用于衡量语言模型回答简短事实性问题(fact-seeking questions)的能力。该基准聚焦于评估模型在获取具体事实信息时的准确性表现。
OpenAI 推出 MLE-bench,这是一个用于衡量 AI 智能体在机器学习工程任务中表现的基准测试。该基准旨在量化评估智能体执行具体机器学习工程工作的能力水平。
Hugging Face 发布 Open FinLLM Leaderboard,专为金融领域大语言模型提供透明评估框架。该榜单覆盖信息提取、情感分析等七大类任务,采用零样本评测方法,使用 Accuracy、F1 Score 等多维指标衡量模型在真实金融场景下的泛化能力与就绪度。
Hugging Face 推出 BenCzechMark,这是首个全面评估大语言模型(LLM)捷克语能力的基准套件。该评测涵盖推理、语法生成及知识提取等9个类别共50项任务,其中90%为原生非翻译内容。目前排行榜已收录超过25个不同规模的开源模型,旨在测试模型在捷克语境下的真实表现。
OpenAI 发布 SWE-bench Verified,这是经过人工验证的 SWE-bench 子集。该基准旨在更可靠地评估 AI 模型解决真实世界软件问题的能力。
Hugging Face 提出 LAVE(LLM-Assisted VQA Evaluation)指标,利用 Llama-2-Chat-7b 对 Docmatix 数据集进行零样本 VQA 评估。
Hugging Face 使用基于 transformers.agents(现已升级为 smolagents)构建的 ReactCodeAgent 在 GAIA 基准验证集上取得 44.2% 的成绩,位列第一。该方案核心在于让 LLM 生成并执行 Python 代码而非 JSON,通过自底向上构建的安全解释器限制操作权限,并结合 Web 浏览、文件检查等工具及简单的规划组件实现多智能体协作。
推荐理由:原文详细拆解了基于代码动作的 Agent 架构与安全执行机制,并展示了在 GAIA 基准上的具体得分与多智能体编排策略。
Hugging Face 推出 BigCodeBench,包含 1,140 个函数级任务,覆盖 139 个库,平均分支覆盖率 99%。该基准旨在解决 HumanEval 任务过于简单及数据污染问题,通过 calibrated Pass@1 评估 LLM 在复杂真实场景下的代码生成能力。
Artificial Analysis 推出基于人类偏好的文生图模型排行榜,利用超45,000次投票计算 ELO 分数。结果显示 Midjourney、DALL·E 3 HD 等专有模型领先,但 Playground AI v2.5 等开源模型正迅速追赶并超越部分闭源产品。用户可在 Hugging Face 参与 Image Arena,投满30票即可获取个性化排名。
Meta 推出开源基准测试框架 CyberSecEval 2,用于评估 LLM 在代码解释器滥用、攻击性能力及提示注入方面的安全风险。数据显示,自 2023 年 12 月首版以来,LLM 协助网络攻击的平均合规率已从 52% 降至 28%,但提示注入防御仍是未解难题。
Hugging Face 推出 Open Arabic LLM Leaderboard (OALL),旨在评估阿拉伯语大语言模型性能,服务全球超 3.8 亿使用者。该榜单整合 AlGhafa、ACVA 等基准数据集,采用归一化对数似然准确率作为核心指标,并基于 lighteval 库实现开箱即用的评测支持。
Hugging Face 发布首个专门评估希伯来语大语言模型的开放排行榜,旨在解决该低资源语言缺乏针对性基准的问题。该榜单包含问答、情感分析、Winograd Schema 和翻译四项任务,采用 few-shot prompt 格式测试模型对希伯来语复杂形态的理解能力。
Hugging Face 正式集成 Artificial Analysis LLM Performance Leaderboard,覆盖超过100个 serverless LLM API 端点。该榜单综合评估模型的质量(基于 MMLU、HumanEval 等)、上下文窗口、定价及推理速度(吞吐量与延迟),支持不同提示长度和并行查询场景下的性能对比。
推荐理由:Hugging Face 引入 Artificial Analysis 排行榜,整合了超过100个API端点的价格、速度和质量数据,为工程师选型提供多维参考。
Hugging Face 联合 Dottxt 提出通过结构化生成解决 LLM 评估对提示格式敏感的问题。实验显示,同一模型在 MMLU 任务中因提示格式微调导致准确率波动高达 10 分,如 Qwen1.5-7B 从 51.2% 降至 22.9%,且 few-shot 样本顺序也会引入约 3 分的差异。
Hugging Face 发布 Open Chain of Thought Leaderboard,通过计算准确率增益(Δ = CoT准确率 - 无CoT准确率)评估LLM生成思维链的能力。该榜单基于LogiQA和LSAT等AGIEval任务,采用Classic与Reflect两种提示策略生成推理轨迹,旨在更稳健地衡量模型推理效能并抵抗训练数据污染。
Hugging Face 发布 Open Medical-LLM Leaderboard,通过 MedQA、MedMCQA 等数据集以准确率评估 LLM 在医疗问答中的表现。该榜单旨在解决 GPT-3 等模型在医疗场景下可能产生严重错误的问题,推动更可靠的医疗 AI 发展。
Hugging Face 推出基于 LiveCodeBench 的排行榜,该基准由 UC Berkeley、MIT 和 Cornell 开发,通过按发布时间窗口评估防止数据污染。它涵盖代码生成、自我修复、执行及测试输出预测四个场景,使用 Pass@1 指标衡量能力。GPT-4-Turbo 在多数场景表现最佳,Claude-3-Opus 则在测试输出预测中超越前者。
UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。
Hugging Face 发布 TTS Arena,借鉴 Chatbot Arena 模式让用户盲听并投票比较文本转语音模型。该工具收录 ElevenLabs、MetaVoice、OpenVoice 等 SOTA 模型,通过 Elo 算法生成公开排行榜。此举旨在解决 WER 和 MOS 等传统指标在评估语音自然度时的局限性,实现开源与闭源模型的公平对比。
Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。
Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。
Patronus 团队基于 Hugging Face Leaderboard Template 发布 Enterprise Scenarios Leaderboard,旨在评估 LLM 在金融、法律、创意写作等 6 类真实企业用例中的表现。该榜单通过准确率、吸引力及 PII 处理等指标衡量模型能力,并采用部分闭源数据集以规避测试集污染问题。
Hugging Face 推出 Hallucinations Leaderboard,利用 EleutherAI Language Model Evaluation Harness 通过 in-context learning 评估 LLM 在事实性与忠实性方面的幻觉表现。
Hugging Face 推出由 HF leaderboard template 驱动的 LLM Safety Leaderboard,聚焦大模型安全评估。该榜单基于获 NeurIPS 2023 最佳论文奖的 DecodingTrust 平台,覆盖毒性、偏见等八个可信度维度。研究发现 GPT-4 比 GPT-3.5 更脆弱,且无单一模型在所有维度均表现最优。
Hugging Face 在两个 7B 模型上实证评估了 DPO、IPO 和 KTO 三种无需强化学习的对齐算法。修正后的实验显示,在配对偏好设置下 IPO 表现与 DPO 相当且优于 KTO。关键超参数 β 的调优对实现最佳性能至关重要。
Vectara 利用 Hugging Face leaderboard template 发布了 Hughes Hallucination Evaluation Model (HHEM) 排行榜,用于评估 LLM 生成摘要时的幻觉频率。该方案通过自定义代码实现动态更新,支持提交新模型请求并自动计算 Factual Consistency Rate 等指标。
Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。
Hugging Face 推出 Object Detection Leaderboard,对 Hub 上的开源目标检测模型进行排名。该博客深入解析 IoU、Average Precision (AP) 和 Average Recall (AR) 等核心评估指标的计算方法。文章旨在帮助开发者理解不同报告间结果差异的原因,从而更批判性地评估模型性能并选择最适合应用需求的模型。
Hugging Face 团队分析了 Open LLM Leaderboard 上 MMLU 分数与论文数据不一致的原因,指出不同评估实现导致结果显著差异。文章对比了 EleutherAI Harness、Stanford HELM 和原始实现三种方法在提示词构造及概率计算上的区别,展示了同一模型在不同方法下的得分变化。最终确认社区维护的评估库更新后已对齐原始实现,并将重新运行排行榜以修正数据。
推荐理由:原文通过对比三种 MMLU 实现方式,揭示了评估细节对模型分数的巨大影响,为理解 LLM 评测差异提供了具体案例。