跳到正文

#推理

今日 0 条
12月17日周三
  1. Google DeepMind86

    Google DeepMind 发布 Gemini 3 Flash:兼顾前沿智能与速度

    Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。

    推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。

12月16日周二
  1. Google Research65

    Google Research 推出 Gemini 驱动的 Paper Assistant Tool 为 STOC 2026 提供自动反馈

    Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。

    推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。

12月4日周四
12月3日周三
  1. Mistral AI87

    Mistral AI 发布 Mistral 3 系列开源模型

    Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。

    推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。

11月19日周三
  1. Hugging Face Blog63

    ServiceNow AI 发布 Apriel-H1:通过蒸馏将 15B 推理模型转为 Mamba 混合架构

    ServiceNow AI 团队发布 Apriel-H1 系列模型,成功将 15B 全注意力推理模型蒸馏为 Mamba 混合架构,在保持推理质量的同时实现 2.1 倍吞吐量提升。

    推荐理由:揭示了蒸馏推理模型时选择高质量推理轨迹而非预训练数据的关键洞察,并提供了可复现的分阶段混合架构转换方法。

9月29日周一
9月12日周五
8月14日周四
8月13日周三
8月12日周二
8月5日周二
  1. Hugging Face Blog98

    Hugging Face 欢迎 OpenAI 开源 GPT OSS 模型家族

    OpenAI 发布了名为 GPT OSS 的开源权重模型家族,包含 gpt-oss-120b 和 gpt-oss-20b 两个混合专家(MoE)模型,均采用 MXFP4 量化并遵循 Apache 2.0 许可证。

    推荐理由:原文详细说明了 GPT OSS 的架构特性、量化方案及在主流框架下的本地部署与微调方法,为开发者提供了从云端 API 到端侧运行的完整技术路径。

7月10日周四
7月8日周二
  1. Hugging Face Blog78

    Hugging Face 发布 SmolLM3:支持 128k 上下文与双模式推理的开源 3B 模型

    Hugging Face 推出完全开源的 3B 参数模型 SmolLM3,包含 Base 和 Instruct/Reasoning 版本,支持英语、法语等 6 种语言及最高 128k 上下文窗口。

    推荐理由:Hugging Face 发布了 SmolLM3 及其完整训练配方,展示了在 3B 规模下通过公开数据实现长上下文和双模式推理的工程路径。

6月10日周二
  1. Mistral AI80

    Mistral AI 发布首个推理模型 Magistral

    Mistral AI 发布其首个推理模型 Magistral,分为开源的 Magistral Small(24B 参数)和企业版 Magistral Medium。

    推荐理由:原文给出了双版本参数规模、AIME2024 具体得分及多语言原生推理特性,读者可据此评估其在专业领域与合规场景下的实际能力边界。

4月30日周三
  1. Hugging Face Blog53

    Hugging Face 深度解析 Qwen-3 Chat Template 的四个关键设计

    Hugging Face 博客通过分析 Qwen-3 的 Jinja chat template,指出其相比前代模型在架构上的四项改进。文章展示了 Qwen-3 如何通过 `enable_thinking` 标志实现可选推理,利用滚动检查点机制动态管理上下文以保留多步工具调用的思维链,优化了工具参数的序列化逻辑以避免双重转义,并移除了默认的系统提示词。

4月26日周六
  1. Hugging Face Blog68

    ServiceNow 开源 PipelineRL:支持飞行中权重更新的 LLM 强化学习实现

    ServiceNow Research 在 Hugging Face 博客宣布开源实验性强化学习实现 PipelineRL,旨在解决大规模 LLM RL 训练中推理吞吐量与在线数据收集之间的权衡问题。

    推荐理由:原文开源了通过飞行中权重更新解决 RL 训练吞吐与数据新鲜度权衡的实现,并展示了在简化算法下达到竞争性基准结果的技术细节。

3月12日周三
2月11日周二
  1. Hugging Face Blog65

    Open R1 发布 OpenR1-Math-220k 数据集及社区进展更新

    Open R1 项目发布 OpenR1-Math-220k 大规模数学推理数据集,该数据集在 512 块 H100 GPU 上本地生成,包含经过 Math Verify 和 Llama3.3-70B-Instruct 双重验证的 220k 条正确推理轨迹。

    推荐理由:原文公开了基于本地算力生成的大规模数学推理数据集及过滤流程,并展示了通过微调复现 DeepSeek R1 蒸馏效果的具体实验数据。

2月2日周日
  1. Hugging Face Blog65

    Hugging Face 发布 Open-R1 项目进展:复现 DeepSeek-R1 训练管线与数据

    Hugging Face 更新 Open-R1 项目进展,旨在复现 DeepSeek-R1 缺失的训练管线和合成数据。团队已在 MATH-500 基准上验证评估结果,并将 GRPO 集成至 TRL v0.14 以支持并行训练。

    推荐理由:原文公开了复现 DeepSeek-R1 的训练管线与合成数据生成细节,提供了可参考的工程实现方案。

1月28日周二
  1. Hugging Face Blog65

    Hugging Face 启动 Open-R1 项目以完全复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 项目,旨在系统性重建 DeepSeek-R1 的数据和训练流程。该项目计划通过蒸馏高质量推理数据集、复现纯强化学习管线以及展示多阶段训练方法,来填补官方未公开代码和数据集的空白,推动开源推理模型的发展。

    推荐理由:原文详细拆解了 DeepSeek-R1 的训练配方并规划了复现路径,为社区提供了构建开源推理模型的具体方法论和数据策略参考。

12月20日周五
  1. Hugging Face Blog62

    Artificial Analysis 发布 Big Bench Audio 数据集以评估音频推理能力

    Artificial Analysis 发布 Big Bench Audio 数据集,用于评估音频语言模型的推理能力。该数据集改编自 Big Bench Hard,包含 1000 个音频问题,涵盖逻辑演绎、导航和计数等类别。

    推荐理由:原文通过对比不同音频处理模式,量化了原生语音模型在复杂推理任务上的性能落差,为评估语音智能体能力提供了具体基准数据。

12月18日周三
  1. Hugging Face Blog68

    IBM 等机构发布 Bamba-9B 混合 Mamba2 模型

    IBM、普林斯顿大学、卡内基梅隆大学和伊利诺伊大学香槟分校联合推出 Bamba-9B,这是一款完全使用开放数据训练的混合 Mamba2 模型。在 vLLM 框架下,该模型相比标准 Transformer 实现了 2.5 倍吞吐量提升和 2 倍延迟加速。目前模型已支持 transformers、vLLM、TRL 和 llama.cpp,并公开了包含有状态数据加载器在内的训练与微调配方。

    推荐理由:IBM 联合高校发布基于开放数据训练的混合 Mamba2 模型,提供显著推理效率提升及完整训练复现资源。

11月25日周一
  1. Hugging Face Blog55

    Hugging Face 博客详解如何从零设计 SOTA 位置编码 RoPE

    Hugging Face 发布技术博客,详细演示了如何从简单的整数编码逐步迭代推导出当前最先进的旋转位置编码(RoPE)。文章分析了正弦位置编码的局限性,解释了为何在自注意力机制中采用乘法而非加法来保留语义信息,并展示了 RoPE 如何通过旋转矩阵实现相对位置的高效编码及向多维数据的扩展。

11月20日周三
  1. Hugging Face Blog38

    BAAI 推出首个多语言 LLM 辩论竞技场 FlagEval-Debate

    BAAI 发布首个多语言 LLM 辩论竞技场 FlagEval-Debate,支持中、英、阿、韩四种语言。该平台引入真实的多模型对抗机制,结合专家评审与用户投票双重指标,旨在解决传统静态评估缺乏区分度及孤立生成导致的偏见问题。开发者可自定义参数策略以优化模型在辩论场景下的推理表现。

10月29日周二
10月16日周三
8月14日周三
  1. Hugging Face Blog60

    Hugging Face 复盘 Infini-attention 实验:为何其长上下文性能随压缩次数下降

    Hugging Face 团队分享了复现 Google Infini-attention 的实验结果,发现随着内存压缩次数增加,模型在长上下文任务中的性能显著下降且不可靠。

    推荐理由:作者详细记录了复现Infini-attention的调试过程与失败原因,揭示了长上下文扩展中压缩记忆的性能瓶颈及收敛难点。

7月24日周三
  1. Mistral AI75

    Mistral AI 发布 Mistral Large 2:1230 亿参数,支持 128k 上下文与多语言

    Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。

    推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。

7月16日周二
  1. Mistral AI62

    Mistral AI 发布 Codestral Mamba:基于 Mamba 架构的代码模型

    Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。

    推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。

7月11日周四
5月16日周四
4月23日周二
4月17日周三
  1. Mistral AI82

    Mistral AI 发布开源大模型 Mixtral 8x22B

    Mistral AI 发布最新开源模型 Mixtral 8x22B,采用稀疏混合专家(SMoE)架构,总参数 141B 但仅激活 39B。该模型支持英法意德西五种语言,具备函数调用能力,拥有 64K tokens 上下文窗口,并以最宽松的 Apache 2.0 许可证发布。在 MMLU、HumanEval 等基准测试中,其性能超越其他开源权重模型,且推理速度优于任何稠密 70B 模型。

    推荐理由:官方详细披露了 Mixtral 8x22B 的稀疏激活参数、多语言基准表现及 Apache 2.0 许可,为评估其成本效率与开源价值提供了一手数据。

2月2日周五
  1. Hugging Face Blog33

    Hugging Face 上线 NPHardEval 排行榜:基于复杂度类评估 LLM 推理能力

    Hugging Face 推出 NPHardEval 排行榜,利用密歇根大学等研发的基准测试大语言模型推理能力。该基准包含900道算法题,涵盖P、NP-complete及NP-hard复杂度类,并每月动态更新以防止过拟合。实验显示GPT 4 Turbo整体表现最佳,Claude 2在NP-complete问题上领先,Yi-34b等开源模型亦具竞争力。

12月20日周三
  1. Hugging Face Blog65

    Hugging Face 演示通过推测解码实现 Whisper 推理 2 倍加速

    Hugging Face 博客展示如何利用推测解码(Speculative Decoding)将 Whisper 模型的推理速度提升约 2 倍,同时保证输出结果与原模型完全一致。文章详细给出了使用 Distil-Whisper 或 Whisper tiny 作为辅助模型的技术实现代码、英语及多语言场景下的基准测试结果,并说明了选择辅助模型和控制批次大小等优化策略。

    推荐理由:原文提供了在 Hugging Face Transformers 中利用辅助模型实现 Whisper 推理加速的具体代码与基准测试数据,展示了无损提速的工程落地路径。

12月11日周一
  1. Hugging Face Blog55

    Hugging Face 详解混合专家模型(MoE)原理与工程实践

    Hugging Face 发布博客详细解析混合专家模型(MoE),涵盖其稀疏性机制、负载均衡策略及在 Transformer 中的应用。文章对比了 Switch Transformers 等经典工作,探讨了 MoE 在预训练效率、微调稳定性及显存占用方面的权衡,并介绍了专家并行、容量因子优化及量化蒸馏等工程落地技术。

12月5日周二
  1. Hugging Face Blog65

    Hugging Face 宣布支持 AMD Instinct GPU 的大语言模型开箱即用加速

    Hugging Face 宣布其 Transformers 库和 Text Generation Inference (TGI) 现已原生支持 AMD Instinct MI250 等 GPU,用户无需修改代码即可在 AMD 硬件上运行大语言模型。

    推荐理由:原文展示了 AMD GPU 在无需修改代码的情况下运行 Hugging Face 模型的能力,并提供了与 NVIDIA A100 对比的性能基准数据。