跳到正文

#论文/研究

今日 0 条
9月22日周一
  1. Hugging Face Blog68

    Hugging Face 发布 Gaia2 智能体基准与 ARE 开源框架

    Hugging Face 联合 Meta 推出 Gaia2 智能体评估基准及配套开源框架 ARE,旨在通过模拟真实世界中的噪声、时间敏感性和 API 故障来测试 AI Agent 的鲁棒性。

    推荐理由:原文提供了 Gaia2 基准与 ARE 框架的完整技术细节及初步模型评测结果,为开发者调试和评估智能体在复杂真实场景下的表现提供了可复用的开源工具链。

9月10日周三
  1. Hugging Face Blog68

    Hugging Face 发布 Jupyter Agent:通过合成数据与简化脚手架增强小模型数据分析能力

    Hugging Face 推出 Jupyter Agent 项目,旨在通过构建高质量训练数据和优化代理脚手架,提升小型语言模型在数据科学任务中的表现。团队利用 Kaggle Notebook 数据集经过多阶段清洗和合成生成约 51k 条轨迹,对 Qwen3-4B 进行全参数微调,使其在 DABStep 基准测试的简单任务上准确率提升至 75%。

    推荐理由:原文公开了从数据清洗到微调的完整流水线及代码,展示了小模型在特定脚手架下性能提升的具体路径。

9月3日周三
8月12日周二
  1. Hugging Face Blog30

    Hugging Face 发布 FilBench:评估 LLM 在菲律宾语言中的能力

    Hugging Face 推出 FilBench,用于系统评估大语言模型在 Tagalog、Filipino 和 Cebuano 上的表现。该基准涵盖文化知识与生成等四大类共12项任务,测试了20多个前沿模型。结果显示,SEA-LION 等区域专用开源模型虽参数效率高,但整体性能仍落后于 GPT-4o,且所有模型在翻译生成任务中均面临挑战。

8月1日周五
5月28日周三
  1. Hugging Face Blog63

    Hugging Face 研究:结构化生成提升 CodeAgent 执行可靠性

    Hugging Face 发布研究指出,强制 CodeAgent 以 JSON 格式生成思考和代码能显著提升执行可靠性。在 SmolBench 基准测试中,该方法使高性能模型的准确率平均提高 2-7 个百分点,并将因解析错误导致的失败率从 2.4% 降至零。

    推荐理由:原文通过对比实验量化了结构化输出对代码智能体解析错误率的降低作用,并明确了模型能力阈值,为 Agent 架构选型提供了具体依据。

4月16日周三
  1. Hugging Face Blog42

    Hugging Face 发布 HELMET:全面评估长上下文语言模型的新基准

    Hugging Face 联合普林斯顿大学推出 HELMET 基准,旨在解决现有长上下文语言模型(LCLM)评估中合成任务与真实性能脱节的问题。该研究评测了 59 款最新 LCLM,发现前沿模型在复杂任务上仍受限,且简单合成任务无法反映下游表现。HELMET 通过多样性、可控性和可靠性三大维度改进评估体系,并支持通过 HuggingFace Transformers 或 TGI 快速部署使用。

3月12日周三
3月11日周二
2月11日周二
  1. Hugging Face Blog65

    Open R1 发布 OpenR1-Math-220k 数据集及社区进展更新

    Open R1 项目发布 OpenR1-Math-220k 大规模数学推理数据集,该数据集在 512 块 H100 GPU 上本地生成,包含经过 Math Verify 和 Llama3.3-70B-Instruct 双重验证的 220k 条正确推理轨迹。

    推荐理由:原文公开了基于本地算力生成的大规模数学推理数据集及过滤流程,并展示了通过微调复现 DeepSeek R1 蒸馏效果的具体实验数据。

1月9日周四
12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

9月23日周一
7月25日周四
7月18日周四
7月11日周四
4月30日周二
3月15日周五
3月5日周二
  1. Hugging Face Blog29

    ConTextual 数据集发布:评估多模态模型在文本丰富场景中的联合推理能力

    UCLA 研究人员推出 ConTextual 数据集,包含 506 个指令,旨在评估大语言模型(LMM)对图像中文本与视觉上下文的联合推理能力。基准测试显示,GPT-4V 等专有模型在信息图和时间读取任务上表现不佳,开源模型如 LLaVA-v1.5-13B 存在显著领域差距。增强型 LLM 方法仅获 17.2% 的人类认可率,表明当前模型在处理文本丰富的真实场景时仍有巨大提升空间。

2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。

5月23日周一
10月25日周一
  1. Hugging Face Blog35

    Hugging Face 社区周项目:使用 10 亿训练对与 TPU v3-8 训练 SOTA 句子嵌入模型

    Hugging Face 在“用 10 亿训练对训练最佳句子嵌入模型”项目中开发了 state-of-the-art 句子嵌入模型。该项目利用 7 个 TPU v3-8 和 JAX/Flax 框架,采用对比学习及 Multiple Negative Ranking Loss 进行训练。通过优化批次大小、引入 hard negatives 及使用缩放余弦相似度,显著提升了模型性能。

7月15日周四
  1. Hugging Face Blog53

    Hugging Face 发布 DeDLOC 算法实现互联网协同训练语言模型

    Hugging Face 联合多家机构提出 DeDLOC 方法,旨在利用志愿者分散的 GPU 资源进行大规模语言模型预训练。团队组织40名志愿者成功预训练了孟加拉语模型 sahajBERT,其下游任务性能接近使用数百个高端加速器的更大规模模型。该实验证明了在普通网络环境下通过自适应梯度聚合实现高效分布式训练的潜力,相关代码已集成至 Hivemind 库。

3月9日周二
  1. Hugging Face Blog23

    Hugging Face 2021年2月阅读组:Long-range Transformers

    Hugging Face 发布2021年2月“长程Transformer”阅读组总结,聚焦降低模型计算成本。文章综述了 Longformer、Compressive Transformer、Linformer 和 Performer 四种方法,分别采用自定义注意力模式、递归、低秩近似和核近似技术。这些方案旨在解决标准自注意力机制随序列长度二次增长的计算瓶颈,支持处理超过512或1024长度的序列。