跳到正文

#DeepSeek

今日 0 条
9月16日周三
8月19日周三
  1. Hugging Face Blog62

    IBM Research 提出 ALTK-Evolve 智能体记忆剂量校准方法

    IBM Research 发布关于 ALTK-Evolve 智能体记忆机制的研究,指出向上下文注入自蒸馏指南的效果取决于模型能力层级,需进行剂量校准而非简单累积。

    推荐理由:原文通过八模型对比实验,揭示了智能体记忆注入剂量需随模型能力校准,为低成本提升任务完成率提供了具体策略。

4月24日周五
  1. Hugging Face Blog95

    DeepSeek-V4 发布:支持百万 token 上下文且专为智能体优化的开源模型

    DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。

    推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。

4月21日周二
  1. Hugging Face Blog30

    Hugging Face 发布 QIMMA:首个通过质量验证的阿拉伯语 LLM 排行榜

    Hugging Face 推出 QIMMA,这是首个整合开源、原生阿拉伯语内容、系统性质量验证、代码评估及公开推理输出的 LLM 排行榜。该基准包含超 52,000 个样本,利用 Qwen3-235B-A22B-Instruct 和 DeepSeek-V3-671B 进行多阶段自动化与人工审核,剔除了广泛使用的阿拉伯语基准中的系统性质量问题。

3月18日周三
  1. Hugging Face Blog75

    Hugging Face 发布 2026 春季开源 AI 现状报告:中国模型下载量超越美国

    Hugging Face 发布《2026 年春季开源 AI 现状》报告,指出过去一年平台用户数接近翻倍至 1300 万,且中国模型的月度及总下载量已超越美国,占据约 41% 的份额。数据显示行业贡献比例从 70% 降至 37%,而独立开发者和小型团体的下载占比升至 39%,机器人数据集数量激增成为增长最快的子社区之一。

    推荐理由:基于平台数据揭示中国模型下载量超越美国及独立开发者占比上升,为判断开源AI地缘格局与社区演变提供量化依据。