跳到正文

#Hugging Face

今日 0 条
9月29日周二
9月16日周三
9月2日周三
  1. Hugging Face Blog42

    Hugging Face 推出 BenchMIRT:审计 LLM 基准测试中各提示词的实际测量能力

    Hugging Face 发布 BenchMIRT,利用多维项目反应理论(MIRT)在单个提示词层面审计 LLM 基准。该方法基于 100 个模型、16 个基准及超 3.4 万个问题的数据训练,独立识别出安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 等基准的得分更多反映通用推理能力而非预设的安全目标,揭示了单一分数掩盖的多重信号。

8月28日周五
8月25日周二
  1. Hugging Face Blog40

    Hugging Face 提出 Quantization-Aware Healing:GPT-OSS 4-bit 模型性能超越全精度原版

    Hugging Face 推出 Quantization-Aware Healing (QAH) 方法,使压缩至 60B 参数并量化为 MXFP4 的 GPT-OSS 120B 模型在 9 项基准测试中的 7 项上超越其 bfloat16 全精度版本。该方法通过直接从原始未压缩模型进行知识蒸馏,解决了结构压缩后传统恢复手段的性能瓶颈,实现了更小、更便宜且更准确的部署效果。

8月21日周五
  1. Hugging Face Blog62

    Hugging Face 发布语音识别基准优化测量研究

    Hugging Face 发布最新研究,提出三种测试方法以量化语音识别模型中的“基准优化”(benchmaxxing)现象。研究发现部分高分开源 ASR 模型会利用 VoxPopuli 和 LibriSpeech 等数据集特有的声学线索来复现参考转录错误、恢复被静音的数字或切换拼写变体,而非忠实转录音频内容。

    推荐理由:原文通过三种探针量化了语音模型对公开基准的过拟合现象,揭示了高分背后的声学线索依赖,为评估真实泛化能力提供了新视角。

8月13日周四
8月11日周二
8月10日周一
  1. Hugging Face Blog42

    Hugging Face 提出高效知识蒸馏方案,大幅降低 LLM 训练显存需求

    Hugging Face 推出离线 Top-K Logits 缓存与融合分块 KL 损失技术,解决大模型知识蒸馏的高显存痛点。该方法避免同时加载教师与学生模型及构建全词表矩阵,将单步训练峰值显存从约 250GB 降至 128GB。这一优化使长上下文修复可在单张 GPU 上运行,显著降低了大规模实验的成本门槛。

7月16日周四
7月15日周三
6月30日周二
  1. Hugging Face Blog32

    DiScoFormer:单 Transformer 同时估计密度与分数

    Hugging Face 推出 DiScoFormer,该模型通过单次前向传播即可同时估计数据分布的密度和分数,无需针对新分布重新训练。在 100 维数据上,其分数误差比最佳 KDE 低约 6.5 倍,密度误差降低超 37 倍,且能泛化至非高斯分布。这一预训练插件式估计器有望大幅降低生成建模及科学计算中的成本。

6月24日周三
  1. Hugging Face Blog42

    Hugging Face 与 Treble Technologies 推出首个开源远场 ASR 基准 FFASR Leaderboard

    Hugging Face 联合 Treble Technologies 上线首个开源远场语音识别(ASR)基准 FFASR Leaderboard,旨在量化模型在真实声学环境下的性能差距。该基准基于14个模拟房间及混合波仿真技术,验证显示低信噪比下远场词错误率(WER)显著高于近场。榜单同时评估准确率与推理速度(RTFx),并计划扩展多人对话及回声消除支持。

6月3日周三
4月21日周二
  1. Hugging Face Blog30

    Hugging Face 发布 QIMMA:首个通过质量验证的阿拉伯语 LLM 排行榜

    Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。

4月16日周四
4月15日周三
  1. Hugging Face Blog60

    IBM Research 发布 VAKRA 基准:揭示 AI Agent 推理与工具使用的失败模式

    IBM Research 推出 VAKRA,这是一个用于评估 AI Agent 在企业级环境中推理和行动能力的可执行基准测试。该基准包含超过 8000 个本地托管 API 和 62 个领域的真实数据库,要求模型完成 3-7 步的复杂推理链。分析显示,尽管现代模型能执行孤立工具调用,但在多跳推理、多源检索及遵守工具使用策略时表现不佳,暴露了从表面能力到端到端可靠性的差距。

    推荐理由:IBM Research 在 Hugging Face 博客发布 VAKRA 基准测试,通过执行轨迹分析揭示了当前 AI Agent 在多步工作流中的具体失败模式。

3月24日周二
  1. Hugging Face Blog48

    Hugging Face 发布语音智能体评估框架 EVA

    Hugging Face 推出首个联合评分任务准确性与对话体验的端到端语音智能体评估框架 EVA。该框架基于 bot-to-bot 架构,提供包含 50 个航空场景的数据集及 20 个系统的基准测试结果。研究发现存在一致的准确性-体验权衡,高任务完成率往往伴随较差的用户体验。

9月3日周三
8月12日周二
  1. Hugging Face Blog30

    Hugging Face 发布 FilBench:评估 LLM 在菲律宾语言中的能力

    Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。

7月23日周三
  1. Hugging Face Blog42

    Hugging Face 开源 TimeScope 基准测试长视频多模态模型理解能力

    Hugging Face 推出开源基准 TimeScope,通过向1分钟至8小时视频中插入5-10秒“针”片段,评估视觉语言模型的局部检索、信息合成及细粒度时间感知能力。该基准揭示 Gemini 2.5-Pro 等前沿模型在长视频时序理解上仍存在显著短板,暴露了当前模型宣称的长上下文处理能力与实际表现间的差距。

7月17日周四
7月4日周五
  1. Hugging Face Blog28

    Hugging Face 宣布 NeurIPS 2025 E2LM Competition:早期训练评估语言模型

    Hugging Face 联合发起 NeurIPS 2025 E2LM Competition,旨在构建捕捉大语言模型早期训练阶段科学知识的基准。比赛基于 lm-evaluation-harness,提供 0.5B、1B 和 3B 参数模型检查点供信号质量评分,隐藏部分数据以防过拟合。冠军奖金为 6,000 USD,结果将于 2025 年 11 月 4 日公布。

6月6日周五
  1. Hugging Face Blog65

    Hugging Face 发布 ScreenSuite:最全面的 GUI 智能体评估套件

    Hugging Face 发布 ScreenSuite,这是一个包含 13 个基准测试的综合评估套件,用于评估视觉语言模型(VLM)在感知、定位、单步操作和多步智能体等方面的能力。

    推荐理由:原文整合了13个GUI智能体基准并统一为纯视觉评估环境,提供了支持本地部署的Docker容器和快速启动指南。

5月28日周三
  1. Hugging Face Blog63

    Hugging Face 研究:结构化生成提升 CodeAgent 执行可靠性

    Hugging Face 发布研究指出,强制 CodeAgent 以 JSON 格式生成思考和代码能显著提升执行可靠性。在 SmolBench 基准测试中,该方法使高性能模型的准确率平均提高 2-7 个百分点,并将因解析错误导致的失败率从 2.4% 降至零。

    推荐理由:原文通过对比实验量化了结构化输出对代码智能体解析错误率的降低作用,并明确了模型能力阈值,为 Agent 架构选型提供了具体依据。

4月16日周三
  1. Hugging Face Blog42

    Hugging Face 发布 HELMET:全面评估长上下文语言模型的新基准

    Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。

4月8日周二
3月20日周三
  1. Hugging Face Blog75

    Hugging Face 发布 Cosmopedia:用于预训练大语言模型的大规模合成数据生成指南

    Hugging Face 推出 Cosmopedia,这是一个包含超过 3000 万个文件和 250 亿 token 的开源合成数据集,旨在复现 Phi-1.5 的训练数据以用于从零开始预训练大语言模型。

    推荐理由:原文详细拆解了从提示词工程到大规模生成的完整技术栈,为复现 Phi 系列合成数据提供了可落地的开源方案。

3月15日周五
3月5日周二
  1. Hugging Face Blog29

    ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力

    UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。

2月20日周二
  1. Hugging Face Blog33

    Upstage 推出 Open Ko-LLM Leaderboard:构建韩语大模型评估生态

    Upstage 于2023年9月发起 Open Ko-LLM Leaderboard,旨在建立透明、公平的韩语大模型评估生态。该平台采用 Ko-MMLU 等五项私有测试集以防止数据污染,上线五个月即收录超1,000个模型。KT 的 Mi:dm 7B 在7B参数以下模型中排名第一并开放使用,SOLAR 及基于 LLaMA2、Yi、Mistral 微调的模型表现强劲。

2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。

1月29日周一
1月18日周四
12月1日周五
  1. Hugging Face Blog40

    Hugging Face 深入分析 Open LLM Leaderboard 中 DROP 基准分数异常原因

    Hugging Face 发现 Open LLM Leaderboard 中多数模型在 DROP 基准的 f1-score 低于 10,主要源于归一化逻辑缺陷及生成停止符设置不当。具体表现为数字后接非空格字符导致匹配失败,以及使用句号作为停止符截断浮点数答案或引发长文本冗余。团队提出改用换行符作为结束标记以修正评分偏差。