跳到正文
原文
Hugging Face Blog·· 2026-09-02AI 评分42

Hugging Face 推出 BenchMIRT:审计 LLM 基准测试中各提示词的实际测量能力

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。

来源:Hugging Face Blog · huggingface.co