UK AISI 与 EvalEval 合作实现基准测试结果可复现
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
UK AISI 利用 EvalEval 基础设施公开分享评估结果,支持可复现的评估科学。此次发布涵盖 HealthBench、FrontierMath 等五个基准及 Claude Opus 4/4.5/4.6、GPT-5/5.2/5.4 六款前沿模型的验证数据。
Hugging Face 联合 Appen Inc. 和 DataoceanAI 在 Open ASR Leaderboard 中新增覆盖多口音的高质量私有 ASR 数据集,旨在防止基准测试优化(benchmaxxing)及测试集污染。默认 Average WER 仍仅基于公开数据集计算,用户可通过切换开关查看私有数据影响。
OpenAI 与太平洋西北国家实验室联合发布 DraftNEPABench,评估 AI 编码智能体加速联邦许可审批的能力。该基准显示,相关技术有望将 NEPA 起草时间缩短最多 15%,并推动基础设施审查现代化。