Google 发布 Gemini 4 Argon,称其为迄今最强大模型
Google 母公司 Alphabet 推出新 AI 模型 Gemini 4 Argon,官方称其为迄今最强大的模型。该模型通过 Fairwind Program 向部分网络安全合作伙伴开放,专门针对防御性网络工作训练,能够自主发现、验证和修补关键软件漏洞。
推荐理由:原文指出该模型专攻防御性网络安全并声称在多项基准测试中领先竞品,读者可据此评估其在特定垂直领域的实际能力与行业地位。
Google 母公司 Alphabet 推出新 AI 模型 Gemini 4 Argon,官方称其为迄今最强大的模型。该模型通过 Fairwind Program 向部分网络安全合作伙伴开放,专门针对防御性网络工作训练,能够自主发现、验证和修补关键软件漏洞。
推荐理由:原文指出该模型专攻防御性网络安全并声称在多项基准测试中领先竞品,读者可据此评估其在特定垂直领域的实际能力与行业地位。
Google DeepMind 推出 Gemini 4 Argon 模型,在 19 项基准测试中的 13 项取得 SOTA,并支持高达 1M token 的输出限制。
推荐理由:原文汇总了 Gemini 4 Argon 的基准测试成绩、定价策略及内部部署案例,读者可据此评估其性能表现与行业影响。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,旨在提升复杂工作流中的深度推理能力,并已通过 Fairwind Program 向受信任的网络安全防御者推出。
推荐理由:原文披露了 Gemini 4 Argon 在长上下文输出、软件工程基准及网络安全防御上的具体性能数据与分阶段开放策略,为评估前沿模型能力边界提供了直接依据。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度提升超过30%,多数工作负载成本降低至多30%。该模型定价与 Sonnet 5 相同,但在各项基准测试中表现更优。
推荐理由:作者实测新模型在编码任务上的表现与成本变化,并复现了特定思考强度下的失败案例。
Google DeepMind 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两款新模型,前者主打智能体工作流与编码,后者专攻网络安全防御。
推荐理由:原文给出了两款新模型在长周期编码和网络安全领域的具体基准表现及定价,读者可据此评估其在自动化工作流中的实际效能与成本优势。
Google DeepMind 发布 Gemini 3.7 Flash,这是其针对编码和智能体任务的最强主力模型。该版本在 FrontierCode 1.1 Main(43.6% vs 34.4%)和 DeepSWE v1.1(65.3% vs 49.0%)等基准上显著优于前代,并支持更高效的 Web 开发工作流。
推荐理由:原文给出了新模型在编码与智能体任务上的具体基准提升及减半的入门价格,读者可据此评估其性价比。
Google DeepMind 正式推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在优化 AI 智能体的构建效率与成本。
推荐理由:官方详细披露了新版 Flash 系列模型的 token 效率提升数据、具体定价及计算机使用能力内置情况,为开发者评估智能体工作流的成本与性能提供了直接依据。
Google DeepMind 推出 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量级网络安全模型,旨在快速查找、验证和修补软件漏洞。
推荐理由:原文披露了基于Flash微调的轻量级网络安全模型及其在漏洞发现与修复上的实测表现,读者可据此评估低成本高频扫描方案对现有防御体系的潜在价值。
智谱(Z.ai)发布最新旗舰模型 GLM-5.2,主打长程任务处理能力并首次提供稳定的 1M-token 上下文窗口。该模型采用 IndexShare 架构降低计算成本,在 FrontierSWE、PostTrainBench 等长程编码基准中表现优于多数闭源模型,成为排名第一的开源模型。
推荐理由:原文给出了1M上下文在长程编码任务中的实测表现与架构优化细节,读者可以据此判断其作为开源旗舰模型的实际工程落地能力。
JetBrains 发布了 Mellum2,这是一个拥有 120 亿参数的混合专家(MoE)模型,每个 token 仅激活 25 亿参数。该模型基于 Apache 2.0 许可证开源,专注于文本和代码任务,相比同尺寸模型推理速度提升超过 2 倍。Mellum2 适用于路由、RAG、子智能体及私有部署等高频低延迟场景,旨在作为大型 AI 系统中的高效组件而非替代所有模型。
Google DeepMind 正式发布 Gemini 3.5 系列并率先推出 Gemini 3.5 Flash 模型,该模型主打智能体(Agent)与编码能力,现已向全球用户开放。
推荐理由:官方详细披露了 Gemini 3.5 Flash 在智能体任务与编码基准上的性能数据及开放入口,为评估其实际工作流替代能力提供了具体依据。
Mistral AI 发布 Mistral Small 4,这是首个将 Magistral(推理)、Pixtral(多模态)和 Devstral(智能体编码)能力统一于一体的 Mistral 模型。
推荐理由:Mistral Small 4 将推理、多模态和编码能力统一于单一开源模型,并提供了具体的架构参数与效率对比数据。
Mistral AI 发布 Leanstral,这是首个专为 Lean 4 证明助手设计的开源代码智能体,拥有 6B 激活参数并采用 Apache 2.0 许可证。
推荐理由:Mistral 发布首个面向 Lean 4 的开源代码智能体,在形式化证明任务中以极低参数量和成本超越多个大型开源模型及 Claude Sonnet。
Google DeepMind 发布 Gemini 3 Flash,旨在以更低成本和更高速度提供接近 Pro 级别的前沿智能。该模型在 GPQA Diamond 得分 90.4%,SWE-bench Verified 得分 78%,比 Gemini 2.5 Pro 快 3 倍且平均少用 30% token。
推荐理由:原文给出了 Gemini 3 Flash 在多项基准测试中的具体分数、定价及与上一代模型的性能对比,读者可据此评估其在速度与成本平衡上的实际竞争力。
Mistral AI 推出新一代开源代码模型家族 Devstral 2(123B)和 Devstral Small 2(24B),并发布了原生命令行工具 Mistral Vibe CLI。
推荐理由:原文给出了两款开源代码模型的参数规模、SWE-bench 得分及配套的终端 CLI 工具,读者可据此评估其在本地部署和自动化编程中的实际效能。
Google DeepMind 正式发布 Gemini 3 Pro,该模型在 Terminal-Bench 2.0 上得分 54.2%,并在 WebDev Arena 中以 1487 Elo 登顶。
推荐理由:原文给出了 Gemini 3 Pro 在智能体编程和多模态推理上的基准表现,以及配套的 Antigravity 平台和 API 定价细节。
Google DeepMind 正式发布 Gemini 3 系列模型,其中 Gemini 3 Pro 已在 Google 搜索、Gemini App 及开发者平台上线。
推荐理由:原文披露了 Gemini 3 Pro 在多项基准测试中的具体分数及 Deep Think 模式的性能提升,并介绍了配套的 Antigravity 开发平台,为评估其实际能力边界提供了量化依据。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和升级版 Devstral Small 1.1,旨在提升智能体编程能力。
推荐理由:Mistral 联合 All Hands AI 推出 Devstral Medium 及 Small 1.1,前者在 SWE-Bench Verified 得分超越 Gemini 2.5 Pro 且价格更低,后者以 Apache 2.0 开源并刷新开放模型代码智能体纪录。
Mistral AI 发布其首个专为代码设计的嵌入模型 Codestral Embed,旨在优化真实世界代码数据的检索性能。该模型在多项基准测试中表现优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型,支持不同维度和精度的输出以平衡检索质量与存储成本。
推荐理由:Mistral 推出首个代码专用嵌入模型,在 SWE-Bench 等真实代码检索基准上超越竞品,并提供灵活的维度与精度权衡方案。
Mistral AI 联合 All Hands AI 推出 Devstral,这是一款专为解决真实 GitHub 问题设计的智能体大模型。Devstral 在 SWE-Bench Verified 基准测试中取得 46.8% 的成绩,比此前开源最佳模型高出 6% 以上,并超越了 Deepseek-V3-0324 和 Qwen3 232B-A22B 等更大参数量的模型。
推荐理由:该模型在SWE-Bench Verified上大幅超越现有开源基准,且支持单卡本地部署,为隐私敏感场景提供了高性价比的编码智能体方案。
Mistral AI 正式发布 Mistral Medium 3,这是一款旨在平衡 SOTA 性能、更低成本和简化部署的新类别模型。该模型在编码和多模态理解等专业用例中表现领先,基准测试显示其性能达到或超过 Claude Sonnet 3.7 的 90%,但 API 价格低至每百万 token 输入 $0.4 / 输出 $2。
推荐理由:Mistral Medium 3 以显著低于竞品的成本提供接近前沿的性能,并支持混合或本地部署,为企业级应用提供了兼顾效率与可控性的新选择。
Mistral AI 发布 Codestral 25.01,采用更高效架构和改进的 tokenizer,代码生成与补全速度约为原版的 2 倍。该模型在 FIM(fill-in-the-middle)用例中达到 SOTA,上下文长度扩展至 256k,并在 HumanEval 等基准测试中领先于同量级模型。
推荐理由:原文给出了新模型的架构改进、速度提升及多语言基准数据,读者可据此评估其在代码补全场景下的实际性能优势。
Mistral AI 正式发布新一代大模型 Mistral Large 2,拥有 1230 亿参数并支持 128k 上下文窗口。该模型针对单节点推理优化,在多语言处理、代码生成及逻辑推理方面性能显著提升,并在 MMLU 等基准测试中达到新的高度。
推荐理由:官方公布 Mistral Large 2 的架构参数、多语言支持及在主流基准测试中的性能表现,为评估其成本效益和实际部署能力提供直接依据。
Mistral AI 发布了 Codestral Mamba,这是继 Mixtral 系列后探索新架构的又一成果。该模型由 Albert Gu 和 Tri Dao 协助设计,利用 Mamba 架构实现线性时间推理和无限长度序列建模的理论能力。
推荐理由:Mistral AI 发布了基于 Mamba 架构的 Codestral Mamba,该模型在代码生成和推理能力上可与 SOTA Transformer 模型媲美,且支持线性时间推理。
Mistral AI 推出其首个专为代码生成设计的开放权重模型 Codestral。该模型参数量为 22B,支持 80 多种编程语言,拥有 32k 上下文窗口,并在 RepoBench 等长程代码生成评测中表现优于竞品。
推荐理由:官方详细披露了 Codestral 的架构参数、多语言支持及基准测试数据,并明确了非生产许可与商业授权路径,为开发者评估其实际编码能力提供了完整依据。
BigCode 团队发布新一代开源代码大模型 StarCoder2 及其训练数据集 The Stack v2,并开放所有模型权重、数据处理和训练代码。StarCoder2 包含 3B、7B 和 15B 三种参数规模,其中旗舰版 StarCoder2-15B 基于 600 多种编程语言和超过 4 万亿 token 训练,性能在同类尺寸中领先并可媲美 33B+ 模型。
推荐理由:原文公开了 StarCoder2 系列模型的参数规模、训练数据细节及代码权重,为开发者提供了透明可复现的开源代码大模型选择。