Google DeepMind 发布 Gemini 4 Argon 模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
OpenAI 的 GPT-6.1 Sol 模型现已在 Amazon Bedrock 上正式可用(GA)。该模型作为 GPT-6 Sol 的重大升级,在 agentic coding、计算机使用和复杂文档分析方面表现强劲,据 OpenAI 称其能以约五分之一的任务成本匹配 GPT-6 Astra 在 DeepSWE v1.1 上的性能。
Hugging Face 推出针对视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型。该模型通过推测解码技术,在仅增加 8.9% 参数量的前提下,实现设备端最高 3.13 倍、H100 上 2.66 倍的解码加速。目前已支持 llama.cpp、MLX-VLM 和 SGLang,提供 Safetensors 和 GGUF 格式供开源部署。
Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。
推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。
Google Research 推出 TimesFM-3,这是一款拥有 3.3 亿参数的最新时间序列基础模型,原生支持多变量预测。该模型通过交替注意力机制和非自回归解码,能在单次前向传播中联合预测多个相关时间序列并处理外部协变量。
Google Research 推出实验性研究能力“行星预测引擎”(PPE),该系统能自主执行从数据发现到模型训练的完整地理空间建模工作流。PPE 通过智能数据选择、多模态数据集整理和自动模型构建三个阶段,将复杂预测模型的构建时间从数周缩短至几分钟。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B 和 30B 三种尺寸,均基于 Apache 2.0 许可证开源。这些模型通过五阶段策略在约 15T tokens 上预训练,并经过监督微调及多阶段强化学习管道训练,其中 8B 和 30B 版本额外进行了智能体强化学习以支持工具调用。所有模型均支持思考/非思考模式切换及原生工具调用,可通过 vLLM 等框架部署。
推荐理由:原文详细拆解了从预训练到多阶段强化学习的完整技术路径,为开发者提供了复现或评估该系列模型能力的具体参考。
Liquid AI 发布适用于 LFM2.5 系列模型的 DSpark 草稿检查点,通过推测解码技术在不改变输出质量的前提下显著提升推理速度。该方案在 H100 GPU 上最高实现 3.18x 吞吐提升,在 M4 Max MacBook Pro 端侧最高实现 2.87x 加速,并已将 llama.cpp 和 SGLang 的集成代码开源。
推荐理由:原文提供了DSpark草稿模型在GPU和端侧的具体加速数据及开源集成方案,读者可据此评估其在本地部署中的性能收益。
Google Research 引入“知识画像”行为框架和 WikiProfile 基准,区分大语言模型中的事实编码与检索能力。研究发现 Gemini-3-Pro 和 GPT-5 等前沿模型的事实编码率高达 95–98%,但仍有 26–34% 的已编码事实无法直接检索,表明事实性错误的瓶颈已从知识获取转向知识利用。
推荐理由:原文提出知识画像框架并构建 WikiProfile 基准,揭示前沿模型事实性错误主要源于检索失败而非编码缺失,为优化模型知识利用率提供新视角。
Google Research 推出基于 Gemini 和 Project Astra 的 AMIE (Video),该系统能在实时视频问诊中感知非语言线索并引导虚拟体格检查。
推荐理由:原文展示了AMIE在实时视频问诊中达到专家级表现的实验设计与结果,为理解多模态医疗AI的感知与推理能力提供了具体依据。
IBM Research发布ALTK-Evolve方法,旨在解决LLM智能体从自身轨迹中学习时的高Token开销问题。与ACE系统每次注入完整Playbook不同,ALTK-Evolve采用按需检索策略,仅向模型提供其能处理的高支持度指南子集。
Google Research 发布论文提出 Chain-of-Evidence (CoE) 框架及 Science One Framework 原型,旨在解决 AI 自主科研中的可验证性问题。该框架通过构建原生证据链,实现了零幻影引用和完全可验证的评分,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准测试中达到 SOTA 性能。
推荐理由:原文提出了基于证据链的可验证性框架,展示了在消除幻觉引用同时保持前沿基准性能的方法。
Berkeley AI Research 与 IBM Research 合作扩展了 K-Search 框架,新增 MLX 后端以自动将 CUDA 内核优化知识迁移至 Apple Silicon。
推荐理由:原文展示了通过结构化翻译层将 CUDA 内核知识迁移至 Apple Silicon 的方法,并给出了在 Attention 和 Mamba SSM 内核上的具体性能提升数据。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。
推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。
Thinking Machines Lab 在 Hugging Face 发布了 Inkling 系列开源多模态大模型,包含总参数约 1T 的 Inkling 和总参数 276B/激活 12B 的 Inkling-Small。
推荐理由:原文给出了1T参数全模态模型的架构细节与部署配置,读者可以据此评估其在多模态推理任务中的实际能力。
Hugging Face 发布 PyTorch Profiling 系列第三篇,深入解析注意力机制的性能特征。文章对比了朴素注意力、原地操作优化以及 SDPA 的 math、efficient、flash 和 cuDNN 四种后端在 GPU Kernel 启动数量、Tensor Core 利用率及 CPU 开销上的差异,展示了如何通过 Profiler 轨迹识别隐藏内存拷贝与算子融合效果。
Mistral AI 发布 Leanstral 1.5,这是一款 Apache-2.0 许可的开源模型,拥有 119B 总参数和 6B 激活参数。该模型在 miniF2F 上达到饱和,并在 FATE-H/X 上取得新的 state-of-the-art 成绩,其解决 PutnamBench 问题的成本约为每问题 $4,远低于竞品。
推荐理由:原文展示了该模型在形式化验证基准上的性能突破及低成本优势,并提供了实际代码缺陷发现案例,为评估其在工程实践中的可用性提供了具体依据。
Goldfeder、LeCun等人在2026年发表《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》,结合优化理论与生物学证明通用性并非性能优势。在算力与数据有限约束下,针对特定任务的专业化系统比追求广泛覆盖的通用模型更具竞争力,实现了从“广度”向“适配度”的战略转移。
Google 推出新架构,将 Multi-Token Prediction (MTP) 头集成到冻结的 Gemini Nano v3 模型中,已在 Pixel 9/10 系列上线。该方案利用零拷贝架构复用主模型 KV cache,节省 130MB 内存,使文本生成速度提升超 50% 且保持输出完全一致。
Gemini-2.5 和 Qwen3-32B 在简单事实问答中启用推理可显著提升答案召回率。该现象由计算缓冲效应与事实启动机制共同驱动,前者通过增加生成 token 提供额外计算时间,后者利用相关事实作为语义桥梁辅助检索。
智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。
推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。
Google DeepMind 推出基于扩散模型的实验性开源模型 DiffusionGemma,在专用 GPU 上实现最高 4 倍的文本生成加速。该模型采用 Apache 2.0 许可证,拥有 26B 总参数但仅激活 3.8B 参数,支持双向注意力以优化代码填充和非线性文本结构生成,目前主要面向追求低延迟的本地交互式应用场景。
推荐理由:该实验性模型通过并行生成机制将本地推理速度提升4倍,为开发者探索低延迟交互工作流提供了新的技术路径。
JetBrains 发布了 Mellum2,这是一个拥有 120 亿参数的混合专家(MoE)模型,每个 token 仅激活 25 亿参数。该模型基于 Apache 2.0 许可证开源,专注于文本和代码任务,相比同尺寸模型推理速度提升超过 2 倍。Mellum2 适用于路由、RAG、子智能体及私有部署等高频低延迟场景,旨在作为大型 AI 系统中的高效组件而非替代所有模型。
Hugging Face 发布技术博客,解释如何通过分离 CPU 和 GPU 工作负载来大幅提升 LLM 推理性能。文章指出同步批处理中 CPU 和 GPU 轮流空闲导致约 24% 的时间浪费,并介绍了使用 CUDA streams 和 events 构建异步流水线的方法。
推荐理由:原文详细拆解了利用 CUDA streams 和 events 实现异步批处理的底层逻辑,提供了消除 CPU/GPU 等待间隙的具体工程方案。
Berkeley AI Research 发布关于自适应并行推理(APR)的综述,探讨大语言模型如何在推理时自主决定任务分解、并行线程数量及协调方式。
PipelineRL 通过修复 logprobs 语义、运行时默认值及 fp32 lm_head,使 vLLM V1 (0.18.1) 在 GSPO 训练中匹配 vLLM V0 (0.8.5) 参考基准。该方案消除了推理引擎与训练器间的 logprobs 偏差,确保 clip rate、KL 和 reward 等指标回归正常轨迹。
Google Research 发布博客,详细介绍其内部科学家及学术合作伙伴如何利用 Empirical Research Assistance (ERA) 工具推进科学研究。
推荐理由:原文展示了ERA在流行病学预测、宇宙学求解及神经科学建模中的具体应用案例,为AI辅助科研提供了可参考的落地路径。
IBM 发布 Granite 4.1 系列大语言模型(3B、8B、30B),采用 Apache 2.0 许可证开源。该系列基于约 15T tokens 进行五阶段预训练,上下文窗口扩展至 512K,并通过监督微调和多阶段强化学习优化。其中 8B 稠密模型在指令遵循和工具调用等任务上表现匹敌甚至超越前代 32B MoE 模型,提供了可预测的延迟和更低成本的企业级解决方案。
推荐理由:原文详细拆解了从预训练到多阶段强化学习的全流程,展示了如何通过严格的数据工程让8B稠密模型在多项指标上匹敌32B MoE架构。
DeepSeek 发布 V4 系列模型,包含 DeepSeek-V4-Pro(1.6T 总参数/49B 激活)和 DeepSeek-V4-Flash(284B 总参数/13B 激活),均支持 1M-token 上下文窗口。
推荐理由:原文详细拆解了 DeepSeek-V4 通过混合注意力机制大幅降低长上下文推理成本的技术细节,并展示了其在智能体任务中的具体性能表现。
Google DeepMind 正式推出 Gemma 4 系列开源大模型,包含 E2B、E4B、26B MoE 和 31B Dense 四种规格,采用 Apache 2.0 许可证。
推荐理由:Google DeepMind 发布 Gemma 4 系列开源模型,提供从移动端到工作站的多种尺寸及 Apache 2.0 许可,展示了其在智能体工作流和边缘计算上的最新进展。
Mistral AI 发布 Mistral Small 4,这是首个将 Magistral(推理)、Pixtral(多模态)和 Devstral(智能体编码)能力统一于一体的 Mistral 模型。
推荐理由:Mistral Small 4 将推理、多模态和编码能力统一于单一开源模型,并提供了具体的架构参数与效率对比数据。
Mistral AI 发布 Leanstral,这是首个专为 Lean 4 证明助手设计的开源代码智能体,拥有 6B 激活参数并采用 Apache 2.0 许可证。
推荐理由:Mistral 发布首个面向 Lean 4 的开源代码智能体,在形式化证明任务中以极低参数量和成本超越多个大型开源模型及 Claude Sonnet。
Google Research 提出“贝叶斯教学”框架,通过监督微调使大语言模型模仿贝叶斯模型的最优概率更新策略。该方法显著提升了LLM在个性化推荐任务中的表现,并证明其能将学到的推理技能泛化至其他领域,克服了默认启发式算法的局限。
Google DeepMind 推出 Gemini 3.1 Flash-Lite,这是其最快且最具成本效益的 Gemini 3 系列模型,现已通过 Gemini API 和 Vertex AI 向开发者和企业开放预览。
推荐理由:官方公布 Gemini 3.1 Flash-Lite 的定价、速度提升及基准测试数据,为高并发场景下的模型选型提供具体参考。
Google DeepMind 正式发布 Gemini 3.1 Pro,作为 Gemini 3 系列的核心智能升级版本。该模型在 ARC-AGI-2 基准测试中取得 77.1% 的验证分数,推理性能较前代提升超过一倍。
推荐理由:原文披露了 Gemini 3.1 Pro 在 ARC-AGI-2 基准上的具体得分及全平台开放入口,读者可据此评估其推理能力跃升幅度与当前可用性。
Google DeepMind 发布 Gemini 3 Deep Think 的重大升级,该专用推理模式旨在解决科学、研究和工程领域的现代挑战。新版本在 Humanity’s Last Exam(48.4%)、ARC-AGI-2(84.6%)和 Codeforces(Elo 3455)等基准测试中创下新高,并在国际物理和化学奥林匹克笔试部分达到金牌水平。
推荐理由:官方公布了Deep Think在科学、工程和数学基准上的最新性能数据及API开放计划,为评估其解决复杂现实问题的能力提供了具体依据。
Google DeepMind 发布两篇研究论文,展示 Gemini Deep Think 模式在专家指导下解决数学、物理和计算机科学领域专业研究问题的能力。
推荐理由:原文展示了 Gemini Deep Think 在纯数学、物理和计算机科学领域的具体科研突破案例及人机协作方法论,为评估 AI 在专业科研中的实际能力提供了详实依据。
Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。
推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。
Google Research 推出名为 Paper Assistant Tool (PAT) 的实验性工具,利用 Gemini 2.5 Deep Think 为 STOC 2026 的理论计算机科学论文提供提交前的自动反馈。
推荐理由:原文披露了基于 Gemini 2.5 Deep Think 的 Paper Assistant Tool 在 STOC 2026 的实验数据,展示了 AI 辅助理论计算机科学论文预审核的实际效果与用户反馈。
Mistral AI 正式推出下一代模型家族 Mistral 3,包括 Mistral Large 3(41B 激活/675B 总参数的稀疏 MoE)以及 Ministral 3 系列(3B、8B、14B 密集模型)。
推荐理由:官方发布了包含稀疏 MoE 大模型和密集小模型的 Mistral 3 系列,全部采用 Apache 2.0 协议开源并支持多模态与推理能力。